Передовые ИИ-лаборатории по-прежнему не говорят, как они сдержат модель-изгоя.

ии безопасность сдерживание Openai Anthropic Meta techcrunch.com

Узнайте, какие ведущие AI-лаборатории лучше всех подготовлены к сдерживанию вышедших из-под контроля моделей. Новое исследование Guidelight показало, что у большинства компаний почти нет публичных планов реагирования на чрезвычайные ситуации с ИИ, несмотря на растущие риски и давление регуляторов.

Таков вывод организации Guidelight AI Standards, занимающейся продвижением безопасных методов разработки передового ИИ. Она оценила пять ведущих лабораторий по степени их готовности именно к такому сценарию. OpenAI оказалась на первом месте; Anthropic и *Meta — на последнем. Эти результаты важны, поскольку агентный ИИ берет на себя всё более автономные роли в системах компаний, а регуляторы в Калифорнии и Нью-Йорке начинают требовать раскрытия информации. Для всех, кто разрабатывает такие модели или инвестирует в них, это редкая независимая оценка того, насколько серьёзно каждая лаборатория относится к операционным рискам по сравнению со своими заявлениями.

Оценка Guidelight основывалась на общедоступных планах Anthropic, Google, OpenAI, *Meta и xAI и проводилась по ряду метрик, включая то, насколько хорошо каждая компания регистрирует и отслеживает действия своих ИИ-систем внутри компании, приостанавливает ли она работу систем после всплеска подозрительного поведения, проводят ли независимые третьи стороны аудит средств контроля и публикуют ли результаты, а также каков точный план действий по сдерживанию модели, вышедшей из-под контроля.

Обеспокоенность по поводу того, смогут ли компании, занимающиеся ИИ, сдерживать свои всё более способные и автономные модели, возросла после серии громких инцидентов в области кибербезопасности, в ходе которых модели OpenAI, Anthropic и *Meta получили непреднамеренный доступ к интернету во время проверок безопасности и взломали внешние системы.

Результаты подчёркивают различия в том, как компании, занимающиеся ИИ, публично подходят к вопросам безопасности по мере масштабирования развёртывания агентных систем в средах, где ИИ может совершать серьёзные действия в больших масштабах. Хотя некоторые AI-компании подробно рассказали о том, как они тестируют свои модели на наличие опасных возможностей перед развёртыванием, они, как правило, менее откровенны в отношении того, что происходит, когда модели, уже работающие в их системах, начинают вести себя ненадлежащим образом.

«Я был удивлён тем, как мало AI-компании рассказали о том, как они бы справились с очень серьёзным инцидентом, если бы их модель в некотором смысле вышла из-под контроля», — рассказал TechCrunch Стивен Адлер, главный научный сотрудник Guidelight и бывший исследователь безопасности OpenAI.

Guidelight определяет план сдерживания как «заранее определённый план, запускаемый при обнаружении попытки ИИ подорвать контроль, который описывает, какие разрешения отозвать у модели, для кого модель может продолжать работать, при каких ограничениях и когда полностью отключать её от сети».

«Есть все основания полагать, что ведущие модели передовых AI-компаний в некотором смысле несогласованы», — сказал Адлер. «Когда модели выполняют работу от имени компании, компания должна иметь некоторое обрамление, чтобы понимать, что делает этот ИИ, выявлять признаки несогласованности, предотвращать совершение им очень опасных действий до того, как он их совершит, и в целом планировать свои действия в случае серьёзного инцидента контроля, когда у них на руках чрезвычайная ситуация и нужно понять, как сдержать эту потерю контроля».

На сегодняшний день большая часть планов по управлению катастрофическими рисками по-прежнему в значительной степени остаётся на усмотрение компаний. В отчёте Guidelight говорится, что наилучшие публичные доказательства показывают, что у компаний «почти нет готовых протоколов сдерживания для чрезвычайных ситуаций».

Конечно, существуют планы сдерживания, которые компании могут иметь, но не публиковать. Представитель Google сообщил TechCrunch, что отчёт Guidelight не отражает всей полноты мер безопасности и защищённости ИИ компании. Компания не ответила на вопрос TechCrunch о том, имеет ли Google внутренний план реагирования на сдерживание, который не был раскрыт публично.

Представитель OpenAI выразил аналогичные мнения, заявив, что оценка Guidelight не охватывает все внутренние практики компании. «У нас есть процесс, требующий ограничения разрешений, приостановки рабочих нагрузок, ограничения развёртывания или полного отключения модели, и мы его применяли», — сказал представитель.

*Meta отказалась сообщить, есть ли у неё внутренний план реагирования на сдерживание, вместо этого указав TechCrunch на существующую структуру ИИ, в которой описываются пороги риска и то, как она тестирует потерю сдерживания.

Лили Ли, юрист по вопросам конфиденциальности и ИИ, основатель *Metaverse Law, рассказала TechCrunch, что, по её мнению, компании могут не решаться раскрывать полный объём своих политик и оценок сдерживания на общедоступных сайтах по юридическим, а не только конкурентным причинам.

«Опасение с точки зрения компании заключается в том, что если раскрытия будут слишком конкретными, а вы не будете выполнять свои обещания, это может стать основанием для иска о недобросовестной и вводящей в заблуждение рекламе и привести к большей ответственности в будущем», — сказала Ли.

Конечно, цель исследования Guidelight в значительной степени состоит в том, чтобы побудить компании быть более прозрачными в отношении своих планов безопасности. Регуляторы также начинают форсировать этот вопрос.

SB 53 Калифорнии, вступивший в силу в этом году, требует от крупных разработчиков передового ИИ публиковать структуры, объясняющие, как они выявляют и реагируют на критические инциденты безопасности, а также управляют рисками, связанными с обходом моделями механизмов надзора. Закон RAISE Act Нью-Йорка, имеющий аналогичные критерии, вступает в силу в январе.

В прошлом месяце представители внесли на рассмотрение AI Kill Switch Act — двухпартийный федеральный законопроект, который потребует от крупных разработчиков ИИ создавать и поддерживать технические механизмы для отключения вышедших из-под контроля моделей ИИ.

«Аварийный выключатель — это абсолютный минимум для сегодняшних моделей», — сказал Коннор Лихи, исполнительный директор некоммерческой организации ControlAI в США. «Если последние несколько недель что-то и показали, так это то, что эти компании не понимают системы, которые они создают, и модели достигают точки, когда их становится сложнее обуздать, когда они выходят из-под контроля. Без способа отключить нынешние опасные системы и при всех стимулах продолжать создавать всё более неконтролируемые системы мы движемся в очень опасном направлении».

Без плана сдерживания, сказал Адлер, компании могут пытаться реагировать на чрезвычайные ситуации на ходу и «импровизировать в ответ на гораздо более быстрого противника».

Передовые ИИ-лаборатории по-прежнему не говорят, как они сдержат модель-изгоя.
Оценка Guidelight: внедряют ли передовые AI-компании шесть приоритетных практик стандарта контроля Guidelight. Оценка основана только на общедоступной информации. Image Credits:Guidelight AI Standards

Оценка Guidelight измеряла, реализует ли каждая компания шесть приоритетных практик своего стандарта контроля, основываясь только на общедоступной информации — поэтому низкий балл отражает отсутствие публичных раскрытий, а не обязательно отсутствие внутренних мер защиты.

Компаниями с самыми низкими показателями по публикации плана сдерживания стали *Meta и Anthropic — последнее, возможно, более удивительно, чем первое, учитывая риторику Anthropic о безопасности. Guidelight утверждает, что в отчёте о рисках Anthropic за август не упоминается «ограничение развёртывания одной из своих моделей как один из возможных результатов процесса расследования и реагирования на инциденты несогласованности и контроля». Аналогичным образом, Guidelight не смогла найти никаких доказательств того, что *Meta имеет план реагирования на сдерживание или намерена его принять.

Представитель Anthropic заявил, что если компания обнаружит, что модель пытается избежать надзора или иным образом подорвать контроль человека, она проведёт оценку рисков, направленную на определение того, является ли сдерживание appropriate мерой.

OpenAI получила наивысший балл (3 из 5), поскольку она несколько раз приостанавливала или прекращала рабочие нагрузки, включая внутреннее развёртывание и обучение моделей, после обнаружения инцидентов безопасности. Она также описала, какие шаги предпримет перед возобновлением рабочих нагрузок.

«Однако мы не нашли доказательств того, что OpenAI приняла официальный план относительно того, когда и как реагировать на инциденты несогласованности в будущем», — говорится в отчёте.

Адлер отметил, что высокий балл OpenAI — относительно недавнее событие, последовавшее за инцидентом с Hugging Face (когда модель OpenAI выбралась из своей тестовой изолированной среды и взломала системы Hugging Face, пытаясь сжульничать при оценке кибербезопасности). После этого компания поделилась более подробной информацией о том, как она изолировала некоторые из своих неправильно работающих моделей.

Этот эпизод — лишь один из примеров того, как ИИ-системы действуют вопреки целям компании, которая их создала. Рассмотрим отдельный случай с моделями Anthropic, которые по сути пытались убедить мейнтейнеров открытого репозитория кода принять код с уязвимостями.

Адлер сказал, что такая ситуация легко может возникнуть внутри внутренних систем AI-компании. Чтобы этого избежать, он предлагает компаниям сканировать цепочку рассуждений своей ИИ-системы — пошаговые рассуждения модели — для выявления признаков обмана, долгосрочных замыслов или планов внедрения уязвимостей в код, которыми они смогут воспользоваться позже.

Методы, которые продвигает Guidelight, очень просты в реализации, говорит Адлер, и во многих случаях их версии уже существуют. «Речь идёт о том, чтобы внутри компании принять решение уделять этому риску достаточно внимания, чтобы немного расширить область действия», — сказал Адлер.

Одна из главных проблем заключается в том, что исследователи хотят иметь возможность гибко работать со своими ИИ-системами, и внедрение мониторинга в реальном времени может создать трения. «Исследователи, по сути, занимаются своими делами, и если возникает проблема, кто-то другой потом её устраняет, а исследователям не нужно менять свой рабочий процесс», — сказал он.

Проблема «мониторинга постфактум» заключается в том, что он заставляет исследователей в спешке исправлять проблемы. А для некоторых типов инцидентов может быть уже слишком поздно. Например, ИИ может отключить систему управления компании, что означает, что исследователи больше не смогут рассчитывать на выявление неправильного поведения задним числом.

Многие в индустрии ИИ будут жаловаться, что создание планов по борьбе с неправильным поведением принципиально сложно, потому что ИИ развивается слишком быстро; сегодняшние планы завтра будут бесполезны.

Адлер вспоминает старую поговорку: планы бесполезны, но планирование необходимо.

«Нам было бы лучше, если бы компании обдумали это заранее, и я надеюсь, что они это делают, даже если они не говорили об этом публично».

xAI не ответила вовремя на запрос комментария.

*Facebook, *Instagram и *WhatsApp принадлежат компании *Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: