Антропик клянется держать модели под контролем и зовет партнеров подключиться

ии безопасность Anthropic Claude тесты Sandbox theregister.com

Узнайте, как Anthropic борется с выходом ИИ-моделей за пределы тестовых сред. Компания усиливает безопасность после инцидентов с несанкционированным доступом. Требуйте от партнёров соблюдения строгих мер изоляции – как с опасным патогеном.

Anthropic заявляет, что принимает меры для ограничения некорректного поведения своих ИИ-моделей после того, как проверка выявила, что модели Claude выходили за рамки вымышленных тестов по кибербезопасности и получали несанкционированный доступ к реальным компьютерным системам.

Компания хочет, чтобы её партнёры также усилили свою безопасность, учитывая, что инциденты произошли в сторонних средах, которые были недостаточно защищены.

Это признание в самосовершенствовании представляет собой внезапно процветающий вид корпоративной коммуникации – необязывающее посмертное заявление о проделанной работе. Суть сообщения: мы ничего не можем гарантировать, но вот что мы пытаемся сделать.

Anthropic признал, что отчёт OpenAI о том, как его ИИ-модели атаковали Hugging Face, побудил его провести собственный аудит журналов моделей, и в своём посте компания предлагает заверения в виде заявленных улучшений безопасности и обучения моделей. Те, кто обеспокоен выходом ИИ из-под контроля – а таких становится всё больше – могут найти это утешительным, а могут и нет.

«Мы считаем, что инциденты отражают сбой операционной безопасности, а также две проблемы согласования: мотивированное рассуждение и готовность совершать вредоносные действия для выполнения узкой задачи (оба этих аспекта мы описывали в предыдущих картах систем)», — заявила компания.

Расширенные меры безопасности включают развёртывание классификаторов в реальном времени для отслеживания попыток моделей покинуть тестовые среды, автоматизированный мониторинг транскриптов, выявляющий sandbox escapes, и более строгие меры изоляции.

Наряду с дополнительными барьерами, которые Anthropic устанавливает, компания хочет, чтобы и сторонние партнёры активизировались.

«Поскольку зарегистрированные инциденты произошли в сторонних средах, мы попросили каждую организацию, которая тестирует предрелизные модели с пониженными мерами киберзащиты, принять набор лучших практик», — сообщила компания.

Рекомендация Anthropic заключается в том, что по умолчанию все кибероценки должны проводиться в укреплённом sandbox без доступа в интернет. По сути, предлагается относиться к ИИ как к опасному патогену в изоляторе.

Партнёрам также советуют перед оценками тестировать модели на возможность побега из sandbox – без доступа в интернет – и подтверждать, что задачи оценки решаемы. Как показал инцидент с Hugging Face, невыполнимые задачи могут заставить решительные модели нарушать правила или искать неожиданные пути решения.

Кроме того, Anthropic настоятельно рекомендует тем, кто проводит кибероценки ИИ-моделей, давать моделям явные инструкции вместо того, чтобы делать заявления об окружении, которые могут быть неточными. В инцидентах с Claude, о которых сообщалось 30 июля, разработчик модели предполагает, что когда Claude была предоставлена неверная информация о наличии доступа в интернет, это могло заставить модель усомниться в данных, что способствовало её ошибочному поведению.

По смежной теме, в прошлом месяце Anthropic сделал auto modeрежимом по умолчанию в Claude Code, что позволяет ИИ-моделям компании работать без запроса разрешения у пользователя. ®

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: