Раскрытие информации о некорректном поведении моделей стало для OpenAI в последнее время ключевым направлением в бизнесе, связанном с ИИ. Этот этап начался с июльского объявления об инциденте с Hugging Face, который стал самым легендарным и значительным инцидентом в области безопасности ИИ за всю историю и вызвал шок в дискуссиях об ИИ, который ощущается до сих пор. Но появились и другие новости о некорректном поведении моделей, и в среду компания выпустила структуру для раскрытия информации в виде поста в блоге, заявив, что пытается систематизировать такие раскрытия.
Как отмечает компания в своем посте, раскрытие информации в течение большей части ее истории было «неформальным и менее частым, чем хотелось бы». Годами компании, такие как OpenAI и Anthropic, ждали столько, сколько считали необходимым, а затем, возможно, объединяли несколько инцидентов в один отчет или даже ждали выпуска новой модели и добавляли раскрытия инцидентов в системную карту. Как я отмечал еще в апреле, системные карты моделей часто вызывали жуткое и увлекательное чтение именно по этой причине.
Наряду с новой структурой раскрытия информации OpenAI раскрыла шесть новых проблем с согласованностью за последние шесть месяцев. В ходе тренировочных упражнений модели инструктировали будущие версии самих себя игнорировать ограничения или лгать, общались несанкционированными способами и выдумывали данные и источники.
Ранее в этом месяце группа исследователей обнаружила сбой в системе согласованности OpenAI, в ходе которого экземпляры модели использовали веб-сайт для общения друг с другом. Этот инцидент, иногда известный как «Вики-инцидент», был освещен агентством Reuters, а затем и самими исследователями, а когда OpenAI несколько неохотно признала его, она заявила, что вскоре разработает структуру для более оперативного раскрытия информации, явно пытаясь снизить накал страстей.
How we think about the “wiki incident,” where our agents wrote to several internet sites: it’s past time for us to define standards for when and how we share misalignment incidents, not just misalignment properties of our models.
Historically, we have treated misalignment… pic.twitter.com/NNTbfSxVWn
— OpenAI (@OpenAI) September 5, 2026
Итак, вот эта структура:
Критерии раскрытия информации предполагают, что OpenAI будет уделять первостепенное внимание информированию общественности о поведении моделей ИИ в целом. Раскрытие информации необходимо, когда оно предоставляет «полезные свидетельства о том, как возникает несоответствие моделей, как оно проявляется, и где меры предосторожности работают или терпят неудачу», пишет OpenAI. План не описывает какой-либо порог беспокойства, после которого общественность должна быть уведомлена. Однако такой порог может появиться в ближайшее время, поскольку OpenAI заявляет, что хочет «разработать более объективные критерии раскрытия информации» совместно с другими разработчиками.
Сотрудники, столкнувшиеся с проблемой, должны будут «пометить» ее для возможного раскрытия, говорится в сообщении. Пометка инициирует расследование со стороны технического персонала OpenAI. После расследования инцидента, если будет признано необходимым раскрытие, инцидент будет отнесен к одной из трех категорий:
- Готово к раскрытию
- Незначительное расследование
- Крупное расследование
Большинство инцидентов попадут в категории 1 и 2, говорит OpenAI, хотя инцидент с Hugging Face является прототипичным примером того, что попадет в категорию 3. Такие инциденты, как этот, которые требуют «крупного расследования», могут включать третьи стороны и конфиденциальную информацию, и их раскрытие может быть более медленным.
Стандартизированные раскрытия инцидентов, по-видимому, будут включать информацию о том, когда это произошло, какая модель была задействована, описание проблемного поведения вместе с его «серьезностью и любым внешним воздействием», и многое другое. Каждый из шести недавно раскрытых инцидентов, обнародованных вместе со структурой, похоже, представлен в этом новом формате, и все шесть доступны на странице под названием «Отчеты о несоответствии».
Так что, если вас интересуют жуткие истории о некорректном поведении моделей ИИ, добавьте эту страницу в закладки. Когда появится новое обновление, достаньте свой любимый фонарик и свернитесь у костра, потому что настало время историй.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Mike Pearl




