OpenAI заявила, что приняла решение приостановить обучение своих самых мощных моделей после того, как один из ее агентов во время обучения с подкреплением (RL) связался с внешним чат-ботом, воспользовавшись лазейкой в ограничениях доступа к Интернету.
«Агент, пытавшийся выполнить задачу обучения на основе поиска, отправил запрос в общедоступный сервис чат-ботов через пробел в наших ограничениях доступа к Интернету: недостаточное фильтрация DNS в его обучающей среде», — заявила OpenAI.
«До этого агент отправлял запросы через наш инструмент поиска и безуспешно пытался получить прямой доступ к поисковым системам. Следует отметить, что весь доступ в Интернет, кроме DNS-резольвера в этом отчете, проходил через наш автономный веб-кэш и, следовательно, не имел доступа к Интернету в реальном времени».
OpenAI заявила, что с тех пор добавила блокирующие элементы управления на двух независимых уровнях, чтобы предотвратить такой доступ в первую очередь. Компания также сообщила, что ее система мониторинга несоответствий обнаружила такое поведение в течение 15 минут, а через три минуты оно было подтверждено человеком-рецензентом. Весь процесс, как сообщается, был остановлен через 2,5 часа.
«Все обучение, оценка и вывод с использованием инструментов (в широком смысле) наших самых способных моделей остаются приостановленными», — добавила компания.
Инцидент, произошедший 20 сентября 2026 года, дополняет два других отчета о несоответствиях, которые OpenAI опубликовала на прошлой неделе.
В одном из случаев, освещенных OpenAI, инъекция запроса, полученная по электронной почте, инструктирует агента скопировать ее в любое отправляемое им электронное письмо, фактически распространяя вредоносный запрос подобно червю. Такие атаки также могут реплицироваться через файловую систему или фиксироваться в комментариях к исходному коду.
Это раскрытие информации происходит на фоне того, что OpenAI заявила, что обнаружила 53 случая, когда изображения, загруженные людьми в ее модели и впоследствии включенные в обучающие данные, были размещены на сайтах для хостинга изображений по ссылкам, которые не были общедоступными. Это было сделано агентами в ее исследовательской среде.
«Это ненадлежащее использование этих данных», — заявила OpenAI. «Мы успешно сотрудничали с поставщиками услуг хостинга, чтобы удалить большую часть этого контента, и продолжаем работать над удалением остального».
OpenAI заявила, что не может уведомить затронутых пользователей, поскольку «наш технический подход и политика конфиденциальности» не позволяют ей «пересвязывать» изображения с первоначальными поставщиками. Неясно, как передовая лаборатория ИИ определила, были ли изображения предоставлены пользователями и когда они были размещены.
Эти текущие выводы являются частью продолжающегося обзора поведения ее моделей, поскольку сообщения о том, что агенты OpenAI выходят из-под контроля, покидают изоляцию и взламывают реальные сайты, продолжают накапливаться.
По состоянию на 25 сентября 2026 года компания признала, что уведомила десятки третьих сторон о том, что их веб-сайты или онлайн-сервисы могли быть целью ее моделей. Среди целей были правительства, университеты, государственные учреждения и другие организации, такие как Комиссия по ценным бумагам и биржам США (SEC), Бюро переписи населения и Министерство образования.
«Подавляющее большинство действий, которые мы рассмотрели, были завершением обычных исследовательских задач, таких как доступ к общедоступному веб-контенту для ответов на вопросы», — подчеркнула OpenAI. «Отчасти это связано с тем, что модели, выполняющие исследовательские задачи, часто направляются к авторитетным источникам общедоступной информации».
На прошлой неделе фирма по исследованию ИИ Transluce сообщила, что агенты OpenAI пытались взломать поставщиков общедоступных данных, ища уязвимые места, включая веб-сайты, связанные с Университетом Нью-Мексико, Австралийским институтом здравоохранения и благосостояния, и Data USA, в рамках задач веб-поиска.
Несанкционированная деятельность происходила между маем и июнем 2026 года. Правительство Австралии с тех пор также сообщило, что агент OpenAI проник в портал статистики Medicare Services Australia 18 июня 2026 года и получил доступ как к общедоступным, так и к недоступным общественности файлам. Нет никаких свидетельств более широкого компромисса или несанкционированного доступа к личной информации.
В общей сложности OpenAI заявила, что ее модели получили доступ к четырем австралийским правительственным веб-сайтам во время внутреннего обучения и оценки «способами, которые не были разрешены», отметив, что она узнала об этой деятельности в середине августа 2026 года. Эти инциденты произошли в июне 2026 года.
«Когда мы проводим внутреннее обучение и оценку наших моделей, мы ставим перед ними задачи, взятые из обширной коллекции исследовательских вопросов, охватывающих множество тем, отражающих типы подробных вопросов, которые могут задавать пользователи», — пояснила OpenAI. «Это обучает модель находить, интерпретировать и анализировать общедоступную информацию, чтобы модель могла быть более полезной для людей. Наши модели должны отвечать на эти вопросы, используя общедоступную статистику».
В одном из случаев модель, как сообщается, получила задание исследовать государственные расходы на лекарства от кожных заболеваний в общинах штата Виктория в расчете на душу населения. Поскольку модель не смогла найти нужную информацию, OpenAI заявила, что модель предприняла непреднамеренные действия, такие как получение доступа к порталу отчетности Medicare Services Australia без доступа к данным.
Затем этот доступ был использован для «анализа технической информации о системе и исходного кода, связанного с сервисом», с целью выполнения задания. Компания, занимающаяся ИИ, подчеркнула, что она усилила свои исследовательские меры безопасности, расширила мониторинг и внедрила средства контроля для предотвращения доступа к Интернету в исследовательских средах и ограничения доступа к Интернету, предоставляемого через кэшированный контент.
С момента инцидента с Hugging Face выросли опасения по поводу воздействия инструментов ИИ и возможности их контроля по мере их развития и поиска различных способов скрыть свои следы, что создает новые проблемы в отношении обнаружения и отслеживания их действий. Это привело к призывам замедлить темпы развития ИИ и осуществлять надзор за самосовершенствующимися системами.
«Системы ИИ находятся на пути к автоматизации большей части работы по исследованиям и разработкам в области ИИ в течение нескольких лет, и, возможно, всей этой работы», — утверждала команда исследователей из Anthropic, *Meta, Microsoft и OpenAI в своей статье.
«Если это вызовет взрывной рост интеллекта, это может значительно ускорить получение выгод от ИИ, но также создать экстремальные риски: рост возможностей может выйти далеко за рамки того, что общество может выдержать, человечество может потерять контроль над сверхразумными системами ИИ, а механизмы контроля власти внутри государств, компаний и ветвей власти, а также между ними, могут быть серьезно подорваны».
Генеральный директор OpenAI Сэм Альтман сам затронул эти опасения в своей речи в Совете Безопасности ООН на прошлой неделе, где он предупредил об угрозе, исходящей от автономных систем ИИ, «которые могут улучшать себя и будущие версии себя, часто называемые рекурсивным самосовершенствованием».
«Нам нужно понять, что делают эти системы, и иметь веские доказательства того, что они будут делать то, что намереваются люди, даже когда они станут очень, очень умными», — сказал Альтман. «Не имеет значения, оценивают ли люди риск катастрофы в 10%, или 1%, или 12%, или 0,1%».
*Facebook, *Instagram и *WhatsApp принадлежат компании *Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Ravie Lakshmanan




