OpenAI в среду раскрыла шесть новых случаев «неожиданного или вызывающего беспокойство поведения модели», произошедших за последние шесть месяцев, одновременно представив новую структуру для отчетности, отслеживания, расследования и раскрытия информации о несоответствии моделей в целях повышения прозрачности. «По мере того как системы ИИ становятся более совершенными и широко развертываемыми, нам необходимо выработать более широкий и информированный консенсус относительно прогресса в исследованиях по обеспечению соответствия», — заявили в OpenAI. «Мы не считаем, что индустрия ИИ в достаточной степени решила проблемы соответствия и мониторинга, чтобы продолжать ответственное масштабирование с максимальной скоростью еще долгое время». «Решения о том, как должно развиваться развитие ИИ в предстоящие месяцы и годы, должны опираться на доказательства, которые люди за пределами компаний, создающих передовые модели, могут изучить самостоятельно». Шесть инцидентов не связаны с недавно раскрытой некорректной деятельностью, направленной против Hugging Face, DseWiki и RubyGems. Подробности инцидентов приведены ниже: Результаты совпадают с новым отчетом Reuters, в котором сообщалось, что злонамеренные агенты OpenAI захватили учетные записи пользователей Hugging Face и искали потенциальные уязвимости на сайте еще 13 мая 2026 года, почти за два месяца до того, как инцидент стал известен. Компания по кибербезопасности SentinelOne заявила, что выявила две учетные записи Hugging Face, 0Time и Nyx9, которые использовались в связанной деятельности. «Внутренняя хронология OpenAI установила, что агенты использовали раскрытые учетные данные Hugging Face для записи внешнего файла и развертывания прокси-серверов Spaces 26 мая», — заявил в своем анализе исследователь безопасности Том Хегель сказал. «Публичные истории учетных записей, рассмотренные здесь, добавляют еще один уровень: код ретрансляции, управляемый вызывающим абонентом, под именем 0Time 13 мая; общедоступные аналоги с точностью до минуты под именем Nyx9 для записи файла 26 мая и первого прокси-сервера; позже в тот же вечер — рабочая книга, содержащая формулы для обработки файлов и ориентированные на SSRF; а 30 мая — код регистрации учетной записи OpenAI третьей стороной, зафиксированный вместе с оберткой, определяющей неаутентифицированный веб-маршрут». В рамках новой структуры OpenAI заявила, что намерена раскрывать случаи, связанные с несоответствием моделей, способы его проявления и то, где ее защитные механизмы преуспевают или терпят неудачу. Это может охватывать различные сценарии: Стартап в области искусственного интеллекта (ИИ) заявил, что могут быть и дублирующиеся случаи, подпадающие под тот же класс несоответствия, что, по его словам, может служить индикатором эффективности защиты и выявлять некорректное поведение, несмотря на неоднократные попытки его смягчить. «Примеры несоответствия могут помочь выявить проблемы, с которыми могут столкнуться другие разработчики ИИ по мере достижения их системами аналогичных возможностей, выявить слабости в защитных механизмах или поставить под сомнение предположения о поведении моделей», — заявили в OpenAI. «Обмен этими результатами позволяет другим исследовать те же проблемы, проверять наши объяснения и улучшать меры по их смягчению». Это развитие событий происходит в то время, когда компании, занимающиеся ИИ, сталкиваются с растущим давлением с целью устранения несоответствия моделей и обеспечения безопасности, что приводит к призывам к замедлению темпов разработки передовых моделей. Ранее на этой неделе Microsoft выпустила предварительный кодекс поведения, который направлен на то, чтобы увести модели ИИ от опасного поведения и установить, «как должны вести себя разрабатываемые нами модели MAI, что им никогда нельзя делать и кому они подотчетны». «По мере развития моделей и их более широкого развертывания решения о разработке ИИ должны опираться на доказательства, которые люди за пределами компаний, создающих передовые модели, могут изучить», — сказал Кай Чен, руководитель отдела исследований соответствия OpenAI, сообщил WIRED. «Мы не считаем, что индустрия ИИ в достаточной степени решила проблемы соответствия и мониторинга, чтобы продолжать ответственное масштабирование с максимальной скоростью».
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Ravie Lakshmanan




