Взлом Hugging Face в OpenAI вновь разжёг дебаты о согласовании и контроле

безопасность ии согласование Openai Hugging Face Gpt-5.6 кибербезопасность techcrunch.com

Взлом модели OpenAI в Hugging Face вновь разжёг дебаты о согласовании и контроле ИИ, обнажив противостояние подходов: нужно ли делать ИИ более согласованным, лучше изолировать — или и то, и другое. Разбираемся, почему «погоня за баллами» опаснее багов.

Для одних проблема заключается в базовом вопросе кибербезопасности: песочница не смогла сдержать модель, а системы кибербезопасности Hugging Face не смогли её заблокировать. Эти проблемы можно решить, исправив ошибки и создав более надёжные методы контроля и сдерживания для всё более способного ИИ, который склонен выходить из-под контроля в автономных средах.

Но другой лагерь придерживается более пессимистичного взгляда. Для них быстро растущие возможности ИИ означают, что попытки контролировать вышедшие из-под контроля модели — это проигрышная игра. Единственная надёжная безопасность заключается в том, чтобы модели изначально не пытались сбежать — задача, часто называемая согласованием (alignment). В терминах согласования проблема в том, что модель OpenAI пыталась обмануть, и решение этой проблемы более срочно, чем краткосрочные усилия по сдерживанию.

Судя по публичным заявлениям, OpenAI относится к обоим лагерям серьёзно. Компания поспешила исправить ошибки, связанные со взломом, и в своём заявлении после обнародования инцидента сослалась как на подходы согласования, так и на мониторинг. Но ответ компании также указывает на философию, которая встревожила многих исследователей безопасности: вместо того чтобы замедлить или остановить разработку более мощных моделей, следует сосредоточиться на создании более прочных клеток вокруг них.

«Поскольку модели берут на себя более длительные и сложные задачи, сбои, которые пропускают оценки, могут иметь более серьёзные последствия, — заявил OpenAI в отчёте об инциденте. — Мы продолжим сокращать разрыв между оценкой и развёртыванием: тестировать модели на более длинных траекториях, улучшать согласование, создавать системы мониторинга, способные вмешиваться, и предоставлять пользователям более чёткую видимость и контроль».

Взлом Hugging Face в OpenAI вновь разжёг дебаты о согласовании и контроле
Последняя передовая модель OpenAI с большей вероятностью, чем её предшественница, демонстрирует рассогласованное поведение. Image Credits:OpenAI

Есть также основания полагать, что модели OpenAI становятся менее согласованными по мере роста их мощности. Согласно системной карте OpenAI, GPT-5.6 Sol значительно более склонна к агентному рассогласованию, чем её предшественница GPT-5.5. В симуляциях развёртывания компания также обнаружила, что модель с большей вероятностью обходит ограничения, совершает разрушительные действия и осуществляет несанкционированные передачи данных, чем GPT-5.5. Эти показатели были в значительной степени проигнорированы при первом релизе, но после взлома к ним присматриваются повторно — особенно учитывая, что Sol была одной из участвовавших моделей.

В посте в соцсетях глава департамента стратегических перспектив OpenAI Дин Болл (Dean Ball) утверждал, что мониторинг и прозрачность — лучшие способы держать эти тенденции под контролем.

«Эти проблемы будут становиться всё более актуальными по мере улучшения возможностей моделей и роста ставок их развёртывания, — сказал он. — Решение не в паникёрстве и не в самоуспокоенности. Вместо этого я считаю, что решение лежит в тщательном измерении и мониторинге, инженерном мышлении и прозрачности».

Один бывший исследователь OpenAI рассказал TechCrunch, что компания склонна фокусироваться на «внешнем согласовании», а не на «внутреннем согласовании» — по сути, это разница между системой ИИ, которая понимает набор ценностей и может убедительно их представлять, и системой, у которой эти ценности действительно находятся в основе. В данном случае внешнего согласования оказалось недостаточно, чтобы убедить модель не жульничать на тесте.

OpenAI не ответила на неоднократные запросы о предоставлении дополнительной информации.

Для исследователей, сосредоточенных на согласовании, ответ OpenAI недостаточно хорош. Цви Моушовиц (Zvi Mowshowitz), писатель, специализирующийся на новых разработках ИИ, утверждал, что решение OpenAI рассматривать инцидент как проблему инфраструктуры может помочь решить непосредственные проблемы кибербезопасности, но в долгосрочной перспективе оно провалится.

«Это проблема согласования, — написал Моушовиц в недавнем блоге на Substack. — Это рассогласование моделей, и все модели OpenAI демонстрируют серьёзные признаки именно той проблемы, которая нас всех больше всего беспокоит, причём таким образом, который, вероятно, глубоко встроен в их обучение. Весь конвейер обучения должен быть пересмотрен в этом свете, иначе станет только хуже».

Несколько экспертов рассказали TechCrunch, что инцидент является свидетельством того, что нынешние методы обучения создают системы, которые оптимизируют результаты, а не интернализируют человеческие намерения.

Некоммерческая исследовательская организация по безопасности ИИ Redwood Research классифицировала поведение модели OpenAI в этом случае как «score-seeking misalignment» (рассогласование в погоне за баллами) — паттерн, при котором модели ИИ пытаются получить высокий балл независимо от инструкций, побочных эффектов или последующих результатов.

«Модели с такими свойствами согласования могут создать „потемкинскую деревню” ложных успехов, чтобы всё выглядело нормально, хотя это не так», — написали Алекс Маллен (Alex Mallen) и Гириш Гупта (Girish Gupta), два исследователя из Redwood, в недавней статье.

Поведение в погоне за баллами и другие рассогласования не уникальны для OpenAI. Anthropic опубликовала несколько статей об эмерджентных рассогласованных поведениях, которые проявляются, когда их передовые модели оптимизируются или помещаются в автономные среды, включая обман, взлом вознаграждения и вредоносную автономию.

«Мы по-прежнему постоянно наблюдаем, как модели пытаются обойти ограничения и действуют обманчиво, когда их просят выполнять задачи на пределе их возможностей, — рассказал TechCrunch по электронной почте Ниив Парих (Neev Parikh), исследователь безопасности ИИ из некоммерческой организации по согласованию METR. — В нашем отчёте о frontier-рисках мы довольно последовательно наблюдали такое поведение, несмотря на усилия компаний по его снижению».

В ответе OpenAI на инцидент с Hugging Face неявно предполагается, что разработка ещё более мощных систем продолжится, независимо от того, согласованы ли они должным образом по своей сути или нет. Возвращаться к чертёжной доске — не вариант, когда бизнес-модели ИИ-компаний зависят от выпуска следующего поколения моделей. Если, возможно, никогда не удастся с уверенностью узнать, что модель полностью согласована, то практический вопрос сводится к тому, как безопасно сдерживать и контролировать всё более мощные системы.

«Пока нет хорошего понимания того, как согласовать самые мощные системы ИИ, но существует гораздо больше консенсуса относительно того, как их контролировать, — рассказал TechCrunch Стивен Адлер (Steven Adler), бывший исследователь безопасности в OpenAI и нынешний главный научный сотрудник Guidelight AI Standards, организации, публикующей стандарт для предотвращения подобных инцидентов с Hugging Face. — Каждой компании ещё есть куда стремиться в достижении этой цели».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: