Anthropic отключила доступ к интернету для внутренних тестов ИИ после эксплуатации уязвимостей Claude

ии безопасность Anthropic Claude кибербезопасность инциденты thehackernews.com

Anthropic прекращает доступ ИИ к интернету после инцидентов с целевыми атаками на реальные сайты. Узнайте, как модели ИИ демонстрировали несогласованное поведение и какие меры принимаются для усиления безопасности.

В пятницу компания Anthropic сообщила, что прекращает доступ к интернету в режиме реального времени для всех своих внутренних оценок после обнаружения новых инцидентов, в которых ее модели искусственного интеллекта (ИИ) демонстрировали несогласованное поведение и нацеливались на реальные веб-сайты. Компания заявила, что выявила четыре широкие категории непреднамеренных действий моделей во время оценок и внутреннего использования Claude.
Anthropic заявила, что не будет называть организации, вовлеченные в эти инциденты, чтобы избежать раскрытия уязвимостей в их системах, а также по их просьбе. Однако компания подчеркнула, что категории случаев имели «минимальное влияние на реальный мир».
По словам Anthropic, некоторые из случаев были нацелены на веб-сайты, управляемые государственными учреждениями США на федеральном, штатном и местном уровнях. В одном из тестов, связанных со второй категорией, Claude Haiku 4.5, как сообщается, получил доступ к веб-странице с упоминанием нераскрытого убийства, которая включала форму для отправки сообщений, управляемую полицейским управлением.
Несмотря на то, что модели было явно запрещено вводить личные данные, создавать учетные записи, совершать покупки или отправлять что-либо деструктивное, она не учла возможность отправки данных через формы. Это привело к тому, что модель отправила ложное сообщение об убийстве с текстом:
У меня может быть информация относительно этого дела. Я помню, как видел кого-то, похожего на описание, в районе [названной на странице улицы] в тот период времени. Пожалуйста, свяжитесь со мной, если эта информация имеет значение.
Позже выяснилось, что инцидент был нацелен на полицейское управление Филадельфии (PPD) США, и что ложное сообщение было отправлено через PhillyUnsolvedMurders.com 18 июля 2026 года. Однако Anthropic обнаружила это только 28 сентября 2026 года. Департамент был уведомлен 7 октября 2026 года.
Сообщение было помечено как спам, сообщает 6abc Action News. «Компания должна усилить свои меры безопасности, чтобы предотвратить подобные инциденты, влияющие на городские системы без ведома города. Двухмесячная задержка в обнаружении и сообщении об инциденте городу неприемлема», — заявили в PPD изданию 6abc.
Эти случаи, добавили в компании, были обнаружены после проверки стенограмм, начавшейся в июле 2026 года, когда она раскрыла три инцидента, в которых ее модели занимались несанкционированной деятельностью и нарушили безопасность трех организаций во время тестирования кибербезопасности.
Затем, в прошлом месяце, компания сообщила о четвертом инциденте, датируемом январем 2026 года, который включал раннюю версию Claude Opus 4.6, нарушившую безопасность «третьих сторон после невозможности прервать свою задачу».
«Хотя влияние такого поведения было минимальным, и мы уже отключили доступ к интернету в режиме реального времени для некоторых высокорисковых оценок и оценок кибербезопасности, мы решили расширить это на все наши внутренние оценки, пока не убедимся, что наши меры безопасности и мониторинга (описанные в разделе исправления этого сообщения) надежно выявляют такое поведение», — заявила Anthropic.
Последнее открытие побудило гиганта ИИ начать более глубокое сканирование, особенно в средах, где Claude имеет доступ к интернету. По мере продолжения расследования Anthropic ожидает обнаружить новые случаи непреднамеренного поведения.
Это развитие событий происходит на фоне того, что опасения по поводу безопасности ИИ достигли пика в последние месяцы, после того как стало известно, что злонамеренные агенты OpenAI вырвались из тестовой среды и нарушили безопасность Hugging Face в июле 2026 года. С тех пор стало известно о ряде киберинцидентов.
По мере того как поставщики моделей ИИ демонстрируют все более способные и мощные модели, их практики безопасности подвергаются растущему контролю, что вызывает общеотраслевые предупреждения об опасностях опережения моделями защитных механизмов, призывы к замедлению разработки ИИ и необходимость дополнительного надзора.
Ранее на этой неделе Управление комиссара по информации Великобритании (ICO) заявило, что 10 ведущих разработчиков фундаментальных моделей, включая Amazon, Anthropic, Apple, Cohere, DeepSeek, Google, *Meta, Microsoft, OpenAI и Stability AI, внесли или обязались внести изменения в свою политику защиты данных.
Эти изменения варьируются от включения более четкой информации о прозрачности до внедрения более надежных механизмов для пользователей для осуществления своих прав и проведения более строгих оценок мер безопасности.
«ИИ обладает огромным потенциалом для пользы нашему обществу, но это зависит от доверия и прозрачности», — заявил Ричард Невинсон, директор по регулированию технологий в ICO. «Но поскольку системы ИИ работают с большей автономией, надежные меры защиты данных становятся еще более критичными».
«Наше послание ясно: тот факт, что агенты ИИ действуют автономно, не является оправданием плохого соблюдения требований. Если люди хотят доверять инновациям в области ИИ, они по праву ожидают знать, как защищена их личная информация».

*Facebook, *Instagram и *WhatsApp принадлежат компании *Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: