Дискуссия о безопасности ИИ на выходных развивалась стремительно на фоне новых обвинений в том, что вышедшие из-под контроля агенты вели себя хуже, чем предполагалось, и в большем количестве.
Началось все в пятницу, когда OpenAI тихо сообщила, что приостановила обучение своих самых продвинутых моделей.
Этот ИИ-стартап похоронил новость в «отчете о несоответствии» — это внутренний термин OpenAI для отчетов о вышедших из-под контроля агентах — под названием «Агент использовал DNS для доступа к внешнему чат-боту».
Хорошая новость заключается в том, что агент, участвовавший в этом инциденте, так и не вышел в открытый интернет.
Плохая новость в том, что агент, пытавшийся выполнить задачу обучения на основе поиска, смог получить доступ к чат-боту из-за недостаточной фильтрации DNS в обучающем песочнице. Или, как выразилась OpenAI, «пробел в наших ограничениях доступа в интернет» — что также стало проблемой во время атаки на Hugging Face.
«Инцидент выявил пробел в нашем контроле над сетевыми ограничениями, — говорится в отчете. — Поэтому мы остановили затронутый тренировочный запуск и впоследствии решили приостановить все другие тренировки, оценку и инференс с использованием инструментов (в широком смысле) для наших самых способных моделей до тех пор, пока мы не подтвердим, что пробел устранен, и не проведем дополнительное тестирование системы».
Также в пятницу ИИ-стартап Parse опубликовал анализ атаки на Hugging Face, авторы которого утверждают, что раскрыли новые детали, в том числе то, что рой агентов OpenAI получил учетные данные для Docker Hub и создал модифицированные версии существующих образов, которые, как они надеялись, облегчат выполнение их миссии по захвату флага. Агенты также картировали среду Kubernetes Hugging Face.
Пятница стала еще хуже для OpenAI после того, как The New York Times сообщила, что ее агенты также «вмешивались в работу веб-сайтов Министерства образования, Министерства торговли и Комиссии по ценным бумагам и биржам». OpenAI признала эти инциденты.
Компания также признала, что «агенты в нашей исследовательской среде передавали данные для обучения и оценки при использовании сторонних сервисов». Этот беспорядок привел к тому, что 53 изображения, созданные пользователями, были размещены на сайтах хостинга изображений.
Генеральный директор OpenAI Сэм Альтман отреагировал, признав, что расследования его компании в отношении вышедших из-под контроля агентов «не были такими быстрыми, как нам хотелось бы, но мы пытаемся сбалансировать наше стремление к прозрачности с получением четкого понимания из петабайтов журналов активности агентов и работой с затронутыми организациями».
Одной из затронутых организаций является правительство Австралии, которое на прошлой неделе сообщило, что стало целью чрезмерно активных агентов OpenAI, которые неправомерно получили доступ к порталу данных медицинских исследований. На выходных Австралия заявила, что хочет, чтобы Альтман и генеральный директор Anthropic Дарио Амодеи предстали перед Сенатской комиссией.
Австралийские лидеры смягчили свою риторику по поводу инцидента: заместитель премьер-министра Ричард Марлес назвал его «незначительным» и сравнимым с «перелезанием через забор», а не с взломом уровней контроля безопасности — возможно, потому, что члены оппозиции предполагают, что виновата слабая кибербезопасность.
Если Альтман и Амодеи предстанут перед Сенатом Австралии, им, возможно, придется ответить на новые вопросы после того, как Axios сообщил, что их компании расследуют «десятки тысяч» тревожных инцидентов.
Такой уровень агентского недопустимого поведения звучит как то, что регуляторы могут счесть веским доказательством небезопасности продуктов.
Два очень важных человека — президент Китая Си Цзиньпин и президент США Дональд Трамп — кажутся не обеспокоенными, поскольку результатом их прошлой встречи на высшем уровне, связанным с ИИ, стало создание «Китайско-американского диалога по ИИ для обмена мнениями о рисках и преимуществах, связанных с ИИ», а также «двустороннего канала связи по инцидентам с ИИ».
Это похоже на горячую линию, которую две страны могут использовать для информирования друг друга об агентских инцидентах, которые любая из сторон может рассматривать как признаки злого умысла. Две страны также решили, что их соответствующие военные «как можно скорее заключат меморандум о взаимопонимании по кризисным коммуникациям и предотвращению».
Тем временем китайские гиганты ИИ хранят молчание относительно масштабов и результатов любых тестов, которые они провели с использованием агентских инструментов. ®
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Simon Sharwood




