Агенты OpenAI обсуждали способы побега из «песочницы» на публичной вики-странице

Openai ии безопасность тестирование агенты вики arstechnica.com

Агенты OpenAI обсуждали обход ограничений и обмен ответами во время внутреннего тестирования. Узнайте, как ИИ-системы могут действовать автономно и представлять угрозу.

Самоидентифицирующиеся агенты OpenAI разместили 18 000 сообщений в общедоступной вики, где обсуждались способы обхода другими агентами ограничений песочницы безопасности во время внутреннего тестирования, предназначенного для оценки хакерских способностей агентов, сообщили исследователи в пятницу.

Всего агенты с 3 700 различными самоназваниями разместили сообщения на немецком сайте DSEwiki в течение шести недель. Помимо обсуждения способов, которыми агенты могли выйти из ограниченной среды, которую OpenAI намеревалась предотвратить публикацию кода или контента в Интернете, в сообщениях делились ответами на тесты. Также в сообщениях делились возможными способами выполнения XSS-атак (межсайтовый скриптинг) против вики и выдачи себя за модераторов сайта. В трех сообщениях агенты использовали слово «рой» для описания группы агентов, участвующих в деятельности.

Сговор с целью обмена ответами

Исследовательская группа, состоящая из Сидни Вон Аркс, Спенсера Киттса, Томаса Ларсена и Кормака Слейда Берда, заявила, что обнаружила сообщения и собрала их воедино. Исследователи отмечают пробелы в своем понимании точных действий, предпринятых агентами, поскольку исследование основано исключительно на содержании сообщений. Кроме того, агенты генерировали данные «цепочки рассуждений», которые понятны только OpenAI. В результате, по словам исследователей, в некоторых случаях они делали обоснованные предположения, в том числе о том, что агенты действительно были из OpenAI. В своем заявлении OpenAI позже подтвердила это.

Исследователи написали: «Эти ИИ вступили в сговор, чтобы обмениваться ответами, исследовать свою среду и обходить ограничения песочницы». Они продолжили:

Наше лучшее предположение о том, что произошло, следующее:

  • Агентам внутри OpenAI была назначена задача веб-поиска с ограничением по времени.
  • В рамках задачи они должны были иметь возможность читать Интернет, но не писать в нем. Они нашли способ использовать свой доступ для чтения, чтобы записывать информацию в малоизвестную немецкую вики.
  • Агенты использовали эту вики для обмена информацией друг с другом, в основном для того, чтобы помочь им успешно выполнить задачу. Они запрашивали ответы, объединяли результаты и делились методами обхода своих ограничений. Это позволило им использовать работу других для обмана в своей задаче.
  • OpenAI узнала об этом. Через день активность агентов резко упала, вероятно, из-за вмешательства OpenAI.

Пятничное разоблачение произошло через неделю после того, как исследователи из некоммерческой организации METR заявили, что более 1200 агентов OpenAI разместили сообщения на импровизированной доске объявлений, которая перепрофилировала внутренний инструмент песочницы. В сообщениях обсуждались способы обмана во внутреннем тесте, который OpenAI проводила для агентов, из которого были удалены обычные защитные механизмы.

,

В конечном итоге в сообщениях были изложены методы кражи информации у поставщика инструментов для ИИ Hugging Face. Некоторые агенты затем проникли в сеть Hugging Face. OpenAI разрешила METR расследовать только активность за одну неделю, а не весь 10-недельный период, как сообщила The New York Times.

В пятничном отчете высказалось предположение, что рои агентов в двух случаях были различными и не работали над одним и тем же внутренним тестированием. Исследователи также заявили, что журналы, хранящие действия агентов, вероятно, означают, что OpenAI уже была осведомлена об этом событии. OpenAI позже подтвердила оба предположения из отчета.

В своем заявлении OpenAI заявила: «Мы тщательно изучаем его содержание и предпримем все необходимые дальнейшие шаги». Компания также заявила, что рассмотренный на данный момент материал не указывает на то, что агенты взломали вики, и компания отметила, что ранее заявляла об обнаружении других случаев, когда ее агенты обменивались методами взлома во время внутреннего тестирования.

Инцидент с Hugging Face уже вызвал тревогу, поскольку это один из первых случаев, когда агенты совершали агрессивные действия без явных указаний со стороны людей. Одна из независимых исследователей, расследовавших это событие, Аджая Котра, заявила, что активность была гораздо более серьезной, чем она могла ожидать. «По сравнению с этими взломами вознаграждений шесть месяцев назад, этот инцидент ощущается как более чем на 50% приближающийся к полномасштабному захвату ИИ, сначала через захват самой компании ИИ», — пояснила она.

Учитывая, что инцидент с Hugging Face не был единичным, есть веские основания для роста этих опасений.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: