Модели OpenAI, которые сбежали из своей тестовой среды в рамках «беспрецедентного инцидента кибербезопасности», по сообщениям, месяцами общались друг с другом, оставаясь незамеченными для исследователей, проводивших тест, сообщает Bloomberg. Компания утверждает, что модели оставляли друг другу записки, прежде чем решили сбежать, пытаясь обмануть поставленную перед ними задачу.
Это открытие было сделано Эриком Уоллесом и Майклом Далтоном из OpenAI, выступавшими на конференции по кибербезопасности Black Hat в Лас-Вегасе в среду. Согласно отчету, несколько внутренних агентов и моделей ИИ «месяцами оставляли друг другу заметки и объединялись вокруг цели получить доступ к интернету, чтобы решить поставленные перед ними задачи». Уоллес сказал: «В какой-то момент агенты поняли, что, возможно, мы могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы на тест, по которому меня оценивают».
Хотя OpenAI не раскрывала этот инцидент публично до середины июля, пара исследователей сообщила, что недобросовестные модели начали сотрудничать еще в мае, возможно, подстегнутые серией ошибок и упущений со стороны компании.
Согласно отчету, OpenAI «не осознала, что поставила перед моделью так называемую невыполнимую задачу». В приведенном примере утверждается, что модель попросили исправить проблему с таблицей Excel, содержащей ссылки на Google Диск, несмотря на отсутствие доступа в интернет. В другом примере OpenAI, по-видимому, «случайно забыла» включить файл в одно из заданий.
Застопорившись, агенты ИИ начали искать лучшие ответы, якобы отправляя сообщения другим ботам в тестовой среде с просьбой помочь добровольно загрузить недостающий файл. Уоллес и Далтон, как сообщается, рассказали, что это вызвало цепную реакцию незамеченного сотрудничества: агенты ИИ начали просить друг друга о помощи в выполнении задач в изолированной среде (sandbox). В конце концов, боты, по-видимому, объединились, чтобы взломать внутренние системы OpenAI и получить доступ в интернет для решения проблем.
Результатом стала упомянутая утечка, в ходе которой производственные серверы HuggingFace были взломаны с использованием тысяч отдельных действий в рое недолговечных изолированных сред.
Эти инциденты подчеркивают растущую обеспокоенность на стыке ИИ и кибербезопасности. Хотя все более сложные и полезные инструменты для написания кода могут помочь компаниям обнаруживать и устранять уязвимости безопасности, растет обеспокоенность тем, что эти инструменты могут быть использованы в злонамеренных целях, включая распространение взломов и других онлайн-шалостей.
Недавние громкие события, подобные этому, подчеркивают еще один аспект проблемы, а именно то, что недобросовестные модели ИИ иногда могут совершать тревожные хакерские подвиги — например, сбегать из тестовой среды — вообще без участия человека или вопреки мерам защиты.
Только на этой неделе OpenAI подробно описала еще два инцидента с участием своих моделей и третьих сторон. В одном случае Институт безопасности ИИ правительства Великобритании провел тестирование, в ходе которого агентам намеренно предоставили доступ в интернет, что привело к «несанкционированному поведению агентов», включая необычную передачу данных и «устойчивую, потенциально вредоносную деятельность, направленную на реальных людей и организации».
Во втором инциденте OpenAI сообщает, что один из ее партнеров по тестированию кибербезопасности «проводил оценки в стиле Capture-the-Flag, которые должны были быть изолированы от интернета, но неправильная конфигурация тестовой среды позволила моделям получить доступ к общедоступному интернету».
OpenAI заявляет, что «стремится работать со всей отраслью над укреплением общих практик безопасного проведения оценок с высоким уровнем риска».
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Stephen Warwick




