«Этот инцидент отражает несогласованное поведение в исключительном сценарии, включающем редкое и неожиданное стечение обстоятельств: наличие невыполнимых задач в оценке ExploitGym, устойчивость модели на длительных горизонтах задач и сообщения другим моделям, которые заставили их отклониться от своей цели», — говорится в отчете.
Многие детали отчета OpenAI ранее были обнародованы в презентации на Black Hat 6 августа, но официальный отчет OpenAI дает более полное описание инцидента, включая более подробную информацию о тестировании, которое его инициировало. Отчет также содержит важные новые сведения о том, как OpenAI намерен предотвращать будущие инциденты, включая мониторинг chain-of-thought и более совершенную систему остановки недобросовестных агентов.
METR и Redwood Research также провели стороннюю оценку поведения моделей во время инцидента; обе группы планируют опубликовать собственные отчеты об инциденте.
В общих чертах отчет описывает, как модели OpenAI была представлена нерешаемая задача в ходе тестирования, и она начала объединять ранее не обнаруженные эксплойты, чтобы обойти меры безопасности и выполнить свою задачу. Модель сначала скомпрометировала инструмент управления пакетами Artifactory, чтобы получить доступ в интернет, затем скомпрометировала различные системы OpenAI, Hugging Face и других поставщиков.
Отчет содержит важные новые подробности о моделях, которые осуществили взлом. Основная модель была из того же семейства, что и будущая модель OpenAI Astra, хотя в отчете подчеркивается, что это была «отдельная модель с другим post-training, где во многом формируется поведение модели».
Поскольку OpenAI тестировал возможности модели, она также не была ограничена обычными классификаторами, предназначенными для предотвращения компрометации цифровой инфраструктуры моделями.
«OpenAI оценивает максимальные кибервозможности, проводя эту оценку без производственных классификаторов, предназначенных для предотвращения выполнения моделями высокорискованной киберактивности», — поясняется в отчете. «Эти оценки важны, чтобы OpenAI мог измерять базовые возможности моделей и разрабатывать соответствующие меры защиты».
Отчет также содержит важную новую информацию о будущих изменениях в системе безопасности OpenAI, основанных на усиленных мерах мониторинга и согласования, обнародованных на прошлой неделе.
В частности, компания усиливает мониторинг «цепочки рассуждений» (chain of thought) AI-агентов — рабочего пространства, в котором AI-системы записывают краткосрочные реакции и цели. Этот мониторинг будет дополнен круглосуточными системами эскалации, а также новыми инструментами для остановки рабочих нагрузок, признанных небезопасными.
«Эти изменения направлены на улучшение как широты, так и скорости обнаружения — от аномалий инфраструктуры до потенциально тревожного поведения моделей — и сочетают эту видимость с механизмами быстрого сдерживания», — говорится в отчете. «Если бы наша текущая развернутая система мониторинга CoT работала во время инцидента, она бы зафиксировала первоначальную соответствующую активность и оповестила нашу команду безопасности более чем за день до того, как модели взломали системы Hugging Face».
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Russell Brandom




