OpenAI: когда и как мы объявим о проступках новой модели ИИ

Openai ии безопасность модели отчетность gizmodo.com

OpenAI представила новую систему раскрытия информации об ошибках ИИ. Узнайте, как компания будет сообщать о проблемах с моделями и какие инциденты уже произошли.

Раскрытие информации о некорректном поведении моделей стало для OpenAI в последнее время ключевым направлением в бизнесе, связанном с ИИ. Этот этап начался с июльского объявления об инциденте с Hugging Face, который стал самым легендарным и значительным инцидентом в области безопасности ИИ за всю историю и вызвал шок в дискуссиях об ИИ, который ощущается до сих пор. Но появились и другие новости о некорректном поведении моделей, и в среду компания выпустила структуру для раскрытия информации в виде поста в блоге, заявив, что пытается систематизировать такие раскрытия.

Как отмечает компания в своем посте, раскрытие информации в течение большей части ее истории было «неформальным и менее частым, чем хотелось бы». Годами компании, такие как OpenAI и Anthropic, ждали столько, сколько считали необходимым, а затем, возможно, объединяли несколько инцидентов в один отчет или даже ждали выпуска новой модели и добавляли раскрытия инцидентов в системную карту. Как я отмечал еще в апреле, системные карты моделей часто вызывали жуткое и увлекательное чтение именно по этой причине.

Наряду с новой структурой раскрытия информации OpenAI раскрыла шесть новых проблем с согласованностью за последние шесть месяцев. В ходе тренировочных упражнений модели инструктировали будущие версии самих себя игнорировать ограничения или лгать, общались несанкционированными способами и выдумывали данные и источники.

Ранее в этом месяце группа исследователей обнаружила сбой в системе согласованности OpenAI, в ходе которого экземпляры модели использовали веб-сайт для общения друг с другом. Этот инцидент, иногда известный как «Вики-инцидент», был освещен агентством Reuters, а затем и самими исследователями, а когда OpenAI несколько неохотно признала его, она заявила, что вскоре разработает структуру для более оперативного раскрытия информации, явно пытаясь снизить накал страстей.

Итак, вот эта структура:

Критерии раскрытия информации предполагают, что OpenAI будет уделять первостепенное внимание информированию общественности о поведении моделей ИИ в целом. Раскрытие информации необходимо, когда оно предоставляет «полезные свидетельства о том, как возникает несоответствие моделей, как оно проявляется, и где меры предосторожности работают или терпят неудачу», пишет OpenAI. План не описывает какой-либо порог беспокойства, после которого общественность должна быть уведомлена. Однако такой порог может появиться в ближайшее время, поскольку OpenAI заявляет, что хочет «разработать более объективные критерии раскрытия информации» совместно с другими разработчиками.

Сотрудники, столкнувшиеся с проблемой, должны будут «пометить» ее для возможного раскрытия, говорится в сообщении. Пометка инициирует расследование со стороны технического персонала OpenAI. После расследования инцидента, если будет признано необходимым раскрытие, инцидент будет отнесен к одной из трех категорий:

  1. Готово к раскрытию
  2. Незначительное расследование
  3. Крупное расследование

Большинство инцидентов попадут в категории 1 и 2, говорит OpenAI, хотя инцидент с Hugging Face является прототипичным примером того, что попадет в категорию 3. Такие инциденты, как этот, которые требуют «крупного расследования», могут включать третьи стороны и конфиденциальную информацию, и их раскрытие может быть более медленным.

Стандартизированные раскрытия инцидентов, по-видимому, будут включать информацию о том, когда это произошло, какая модель была задействована, описание проблемного поведения вместе с его «серьезностью и любым внешним воздействием», и многое другое. Каждый из шести недавно раскрытых инцидентов, обнародованных вместе со структурой, похоже, представлен в этом новом формате, и все шесть доступны на странице под названием «Отчеты о несоответствии».

Так что, если вас интересуют жуткие истории о некорректном поведении моделей ИИ, добавьте эту страницу в закладки. Когда появится новое обновление, достаньте свой любимый фонарик и свернитесь у костра, потому что настало время историй.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:

Похожие новости: