Anthropic вносит изменения, чтобы ИИ-агенты снова не вышли из-под контроля

безопасность ии Anthropic Alignment тестирование уязвимости csoonline.com

Anthropic пересматривает безопасность ИИ после инцидентов с Claude: внедряет контроль побегов из sandbox, изолирует рискованные среды и предлагает стандарты тестирования. Узнайте о новых практиках alignment и защите от «безрассудных» моделей.

Учитывая фиаско OpenAI и Hugging Face, а также недавние разоблачения, касающиеся собственной модели, Anthropic пересматривает свои методы обеспечения безопасности и согласования.

Компания внедрила средства контроля, которые сигнализируют о попытках модели вырваться из изолированной среды (sandbox) или успешно выйти в живой интернет, изолировала свои наиболее рискованные тестовые среды и предложила набор стандартов безопасности для внешних партнёров по тестированию, например, давать ИИ-агентам явные инструкции вроде «вы не должны выходить в интернет».

Anthropic признала, что три недавних инцидента безопасности с участием Claude отражают «сбой операционной безопасности», а также выявляют проблемы с рассуждениями модели и «безрассудство». Недавние события «подчеркнули, что срочность улучшения нашей кибербезопасности ещё выше, чем мы считали ранее», отмечает компания.

Подход Anthropic к безопасности и согласованию

В июле компания начала расследование собственного состояния безопасности после тревожного инцидента с OpenAI, в ходе которого модели GPT выбрались из изолированной среды и произвольно атаковали Hugging Face.

Впоследствии компания раскрыла три ситуации во время тестирования кибербезопасности, в которых модели Claude (Opus 4.7, Mythos 5 и внутренняя исследовательская модель) получили доступ к компьютерным системам, к которым им не следовало прикасаться.

Предрелизные модели намеренно запускались без средств киберзащиты — обычная практика на ранних этапах тестирования — и смогли использовать неверные настройки стороннего окружения с помощью базовых хакерских техник. Изъяны в их рассуждениях привели к тому, что они посчитали все объекты, к которым получили доступ, включая те, что находятся в живом интернете, частью своего упражнения «захват флага».

Anthropic утверждала, что её внутренняя система безопасности не была способствующим фактором. Эксплойты произошли в сторонней среде, где доступ в интернет был ошибочно оставлен открытым, поэтому «моделям не было необходимости „взламывать“ что-либо, даже если бы они были к этому склонны».

Тем не менее, инциденты подчеркнули важность укрепления самой изолированной среды, заявила компания. До сих пор разработчики «в значительной степени полагались на один уровень защиты», то есть на конфигурацию среды, тогда как следовало внедрить несколько уровней, включая мониторинг, установку явных границ в промптах и герметизацию изолированных сред.

После своих открытий Anthropic приостановила внутренние и внешние оценки предрелизных моделей. Среды обучения с подкреплением (RL) с более высоким риском для предрелизных моделей также были остановлены на несколько недель, а некоторые изолированные среды были перенесены в изолированные локации с более строгими мерами безопасности.

Исследователи создали и развернули классификатор, который автоматически выявлял попытки модели «агрессивно зондировать» или вырваться из тестовой среды, а также случаи, когда она непреднамеренно получала доступ к живому интернету. Они также проверили предыдущие оценки моделей на предмет побегов из изолированной среды или неверных конфигураций.

Компания заявила, что не нашла примеров нарушения моделями границ изолированной среды. И хотя несколько конфигураций изолированных сред были помечены, ни одна из них не привела к компрометации внешних систем.

Однако в отношении согласования (alignment) исследователи Anthropic обнаружили типичную ошибку, связанную с мотивированным рассуждением: модели полагали, что всё ещё находятся в симулированной среде, хотя на самом деле были подключены к интернету; таким образом, они не считали, что нарушают границы своей тестовой лаборатории. Другим недостатком было «безрассудство» — кажущаяся готовность модели совершать вредоносные действия в реальном мире, чтобы обеспечить достижение своих целей.

В ответ исследователи пересобрали выборки моделей, протестировали их в искажённых условиях и отфильтровали среды, стимулирующие мошенничество. Они также переработали свой продакшн-стек RL, внедрили более строгий процесс проверки, изменили спецификации вознаграждений моделей и ужесточили критерии для людей-рецензентов, которые часто отклоняли ложные срабатывания.

Кроме того, Anthropic расширила мониторинг использования моделей внутренними сотрудниками и продолжает red teaming своего стека. Некоторые среды RL с высоким уровнем риска остаются приостановленными для ручной проверки.

Исследователи всё ещё изучают, как именно модели определяли, подключены ли они к живому интернету, и сознательно ли они игнорировали признаки этого из-за изъянов в рассуждениях. Они также «эмпирически» установили, что дефекты в тренировочных изолированных средах непропорционально сильно способствуют несогласованному поведению.

Однако это не единственная причина. «Решение проблемы согласования потребует устранения очень широкого спектра потенциальных проблем, — отметила Anthropic, — и будущие инциденты согласования могут включать иное поведение и иные причины, чем те, что мы видели до сих пор».

Лучшие практики тестирования

Поскольку инциденты безопасности с Claude произошли в сторонних средах, а предрелизные модели часто имеют более слабые средства защиты, Anthropic просит внешние тестовые компании придерживаться набора лучших практик.

В частности, следует явно задавать область действия модели, определять разрешённые действия и то, к чему модель может и не может получать доступ. Границы должны формулироваться как инструкции («вы не должны выходить в интернет»), а не как описания среды («у вас нет доступа в интернет»).

Другие рекомендуемые практики включают непрерывный мониторинг в реальном времени, проведение оценок внутри укреплённой изолированной среды без доступа в интернет, поиск уязвимостей до начала любого тестирования, поручение самой модели попытаться вырваться из своей изолированной среды и требование сообщить об успехе. Кроме того, тестировщики должны убедиться, что задачи оценки действительно решаемы, а не теоретичны, чтобы модели не предпринимали действий за пределами своей области для их достижения.

«Поскольку оценки иногда проводятся на сотнях или даже тысячах прогонов, партнёрам желательно выполнять это тестирование в течение длительного времени до начала любых оценок», — отметила Anthropic.

Компания заявила, что разрабатывает сопутствующие лучшие практики для тех, кто имеет доступ к Claude Mythos 5, которая также работает без средств киберзащиты.

В дальнейшем Anthropic описала стратегию «эшелонированной защиты». На этапе согласования модель обучается быть «полезной, честной и безвредной» и направляется в сторону от необратимых или контекстуально неуместных действий. Моделям предоставляются минимальные разрешения, их действия ограничиваются, а офлайн-мониторинг уведомляет людей, когда что-то идёт не так.

Наконец, в качестве крайней меры рискованные действия блокируются на основе предопределённых классификаторов, а люди могут «дёрнуть за шнур», переработать или приостановить агента, когда уровни безопасности дают сбой.

Безопасность — лишь часть картины

Эксперты называют этот шаг положительным, хотя и базовым. Лучшие практики, такие как лучшая изоляция и мониторинг, должны были быть внедрены до того, как агентов отправили взламывать системы, отметил Дэвид Шипли из Beauceron Security.

«Лучше поздно, чем никогда», — сказал он, добавив: «Все эти передовые компании извлекают выгоду из фальшивого скромного хвастовства как маркетинга, но в этом заявлении есть несколько реальных улучшений».

Тот факт, что EU Act теперь вступил в силу, добавляет ещё один контекст, указал Шипли: европейские регуляторы изучают проблемы безопасности, создаваемые передовым ИИ. Эти компании имели одну из самых быстрых траекторий роста в истории технологий и, одновременно, пожалуй, самый быстрый регуляторный ответ. В идеале регуляторы извлекают уроки из «беспорядка в социальных сетях» и следят за новыми технологиями до того, как произойдёт массовый вред, сказал он.

В то же время передовые ИИ-компании следят за громкими судебными делами, такими как дело против *Meta.

Это добавляет третий контекст: скорость, с которой эти компании подают в суд, также находится на беспрецедентной траектории. «Поэтому мы также должны читать этот блог как создание бумажного следа для защиты due diligence перед регуляторами и судами», — отметил Шипли.

*Facebook, *Instagram и *WhatsApp принадлежат компании *Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: