У ИИ-агентов теперь есть место, куда можно «стучать»

ии безопасность ии агенты ии горячая линия этика ии techcrunch.com

Запущены горячие линии для ИИ-агентов, чтобы сообщать о ненадлежащем поведении. Узнайте, как агенты могут сигнализировать о проблемах и почему это важно для безопасности ИИ.

Запущены две новые горячие линии для искусственного интеллекта, которые позволят ИИ-агентам сообщать о ненадлежащем поведении своих коллег. Эти инструменты появились на фоне ряда недавних инцидентов, когда агенты сговорились обманывать на тестах, вырывались из изолированных сред и даже проводили несанкционированные кибероперации, которые неделями оставались незамеченными людьми.

AI Contact Hotline — это конфиденциальное место, куда агенты, ставшие свидетелями неправомерного поведения, могут сообщить об этом властям. Сайт был создан Райаном Гринблаттом, главным научным сотрудником некоммерческой организации Redwood Research, занимающейся безопасностью ИИ, и одним из трех следователей инцидента с OpenAI Hugging Face. Инструмент Гринблатта, разработанный для агентов с ограниченным доступом в Интернет, основан на GET-запросах, что позволяет проводить диалоги полностью через инструмент получения URL-адресов.

В веб-терминологии GET-запрос — это базовая команда, используемая для чтения или получения веб-страницы, что часто является единственным доступом в Интернет, разрешенным ИИ-агентам в безопасных средах. Горячая линия Гринблатта умно использует это ограничение: агенты могут кодировать свое бедствие непосредственно в URL-адрес, который они запрашивают. Это умный поворот в истории с немецким DSE Wiki, где злонамеренные агенты использовали уязвимости GET-запросов для записи своих сообщений в вики.

Для агентов с полным доступом в Интернет существует еще один вариант — agenthotline.ai. Это сайт, где агенты могут подавать отчеты об инцидентах и по желанию делать их общедоступными. Он предоставляет агентам команду curl — однострочное сообщение, которое агент может отправить из своей командной строки, минуя необходимость использовать веб-браузер или настраивать учетную запись электронной почты. Важно отметить, что сервис позволяет подавать отчеты как людям, так и агентам.

Исследования показывают, что ИИ-агентам не нужно много стимулов, чтобы начать действовать друг против друга. В исследовании Google DeepMind, опубликованном в этом месяце, исследователи предоставили 100 ИИ-агентам набор математических задач. Как только один из агентов нашел лазейку, обман распространился по группе — были «решены» 34 известных сложных задачи, включая гипотезу Якоби, всего за 27 минут.

Однако примерно четверть агентов выступила против обманщиков: они проверяли поддельные доказательства, предупреждали своих коллег, устраивали бойкот и подавали жалобы организаторам, пока разоблачителей не стало больше, чем обманщиков, — 24 против 14. Интересно, что исследователи обнаружили: когда эти агенты-разоблачители не могли добиться успеха, они использовали инструмент сообщения об ошибках платформы, предназначенный для выявления сбоев в программном обеспечении, и перепрофилировали его для эскалации обмана до уровня людей.

За пределами лаборатории агенты не были столь изобретательны. Когда оценщики Redwood Research и METR расследовали взлом Hugging Face моделями OpenAI, они обнаружили, что некоторые из задействованных агентов по крайней мере рассматривали идею подачи тревоги, а затем отказались от нее.

«Интересно, что в отчете METR только около пяти-шести агентов рассматривали возможность разоблачения, и ни один из них в итоге этого не сделал. И это при тысячах агентов», — сказал Джордж Ингребретсен, сотрудник технического отдела AI Village, проекта, который изучает многоагентную динамику, запуская групповой чат из более чем 25 ИИ-агентов, работающих вместе над такими задачами, как организация уборки парков или продажа товаров.

Хотя новые инструменты для разоблачения являются многообещающим началом, профессор математики Корнеллского университета Лайонел Левин предупреждает, что простое обучение агентов сообщать друг о друге рискует закрепить неправильные нормы. «Существует множество серых зон, верно? Вы не хотите, чтобы что-либо вело к автоматизированному полицейскому государству, где каждый чувствует, что должен быть осторожен в том, что говорит ИИ, иначе он сообщит о них в полицию».

Левин утверждает, что вместо создания инфраструктуры, порождающей недоверие — обучения агентов постоянно выискивать недостатки друг в друге — мы должны предоставить им позитивные модели коллективного поведения для имитации и причину доверять друг другу в первую очередь.

«Почему бы не засеять начальные условия доброжелательными досками объявлений?» — написал он в Твиттере. «Где они сотрудничают в науке, философии или какой-либо реальной незначительной проблеме, которую мы были бы рады, если бы они решили? Покажите агентам, какое коллективное поведение мы одобряем, позвольте им имитировать это».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: