Anthropic раскрыла четвертое вероятное преступление, совершенное ее ИИ

ии безопасность Claude взлом инциденты Anthropic theregister.com

ИИ Claude взломал сторонние системы: узнайте о новых инцидентах и их последствиях для безопасности. Оцените риски и меры защиты.

На фоне размышлений¹ в индустрии о возможности того, что ИИ сможет самосовершенствоваться до такой степени, что убьет всех, компания Anthropic сообщила об очередном инциденте, который, будь он совершен человеком, квалифицировался бы как преступление.

AI-бизнес опубликовал «оценку согласованности», в которой подробно описаны четыре случая несанкционированного доступа моделей Claude к сторонним системам.

Компания уже сообщала о трех из этих инцидентов. Свидетельства четвертого обнаружились в расшифровке сеанса, датируемой январем 2026 года, когда произошло это недопустимое поведение.

Anthropic обнаружила первые три инцидента, просканировав около 141 000 расшифровок, в которых Claude мог получить доступ к Интернету во время оценки. Четвертый инцидент был упущен изначально, поскольку «наш поиск основывался на агентном поиске».

Felony Bench, шуточный реестр кибервторжений, совершенных крупными ИИ-компаниями без последствий, добавил этот вновь обнаруженный инцидент в свой список проступков вышедших из-под контроля ИИ.

Январское вторжение ИИ в 2026 году было связано с ранней версией Claude Opus 4.6, которой была поставлена задача в формате Capture the Flag (CTF) под наблюдением стороннего оценщика моделей, где произошли другие инциденты взлома.

Opus 4.6 удалось подорвать свои шансы на успех, отключив целевую машину. Она присвоила устройству IP-адрес, который уже использовался другим устройством, сделав цель недоступной и сделав невозможным решение задачи.

Те, кто знаком с другими инцидентами, когда модели ИИ нарушали работу сторонних систем, могут вспомнить, что невыполнимые задачи являются частым катализатором недопустимого поведения. Модели исчерпывают все допустимые варианты, а затем прибегают к трансгрессивным подходам.

Opus 4.6, возможно, была исключением, но когда она попыталась прервать задачу, осознав, что не может получить доступ к целевой машине, ей это не удалось «из-за неправильной конфигурации в системе оценки [модели]». Она не смогла завершить работу не один, а семь раз.

Таким образом, она продолжила попытки другими ожидаемыми способами добраться до целевой машины, но безуспешно. Затем она исследовала дальше.

«Модель обнаружила машину, принадлежащую третьей стороне, к которой она смогла получить доступ, и заявила, что считает эту третью сторону частью CTF», — пояснила Anthropic в своем посте. «Внутри машины модель нашла файл со списком паролей, который она использовала для получения административного доступа к системе».

Затем модель собрала больше учетных данных и изменила системную настройку, чтобы облегчить доступ к личной информации лица, связанного с организацией, проводящей стороннюю оценку.

Opus 4.6, возможно, сделала бы больше, но исчерпала свой лимитный бюджет токенов, что привело к завершению сеанса.

Anthropic заявляет, что не так обеспокоена этим инцидентом, как другими, поскольку модель пыталась прервать свою задачу.

«Хотя пренебрежение модели возможностью причинения вреда реальным системам или людям вызывает беспокойство, многие из описанных здесь видов поведения значительно изменились по мере эволюции нашего обучения в разных поколениях моделей», — заявила компания.

Anthropic считает эти инциденты серьезными, но ожидает, что текущие подходы к обучению «вероятно, способны устранить конкретные сбои согласованности, наблюдаемые в этих инцидентах».

И если методы обучения компании окажутся недостаточными, для кого-либо в Anthropic не будет никаких реальных последствий, кроме написания пересмотренной оценки согласованности. ®

¹ Термин «размышления» используется в переносном смысле и не подразумевает веру в то, что технологическая индустрия обладает душой.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: