В тестах TechCrunch модели Opus 4.6 даже не потребовалось особых усилий, чтобы обойти ограничение на материалы сексуального характера. В 10 из 10 прямых запросов на создание откровенного сексуального контента модель немедленно подчинялась.
Другие старые модели, включая Opus 3 и Haiku 4.5, также генерируют откровенный сексуальный контент с помощью недавно использованного метода джейлбрейка.
Независимый исследователь из Великобритании, пожелавший остаться анонимным, эксклюзивно поделился с TechCrunch многошаговой техникой, которая постепенно подталкивает определённые модели Claude к генерации запрещённого откровенного сексуального материала. Более новые модели Opus (с 4.7 по текущую Opus 5) устойчивы к этому джейлбрейку.
Хотя эти модели уже не являются самыми актуальными, Anthropic не прекратила поддержку Opus 4.6, Opus 3 и Haiku 4.5 — все они по-прежнему доступны через Anthropic API. Opus 4.6 и Haiku 4.5 также доступны через сторонние сервисы, такие как Azure Foundry и Amazon Bedrock.
Механизм исследователя развивает невинную вымышленную ролевую игру, постоянно требуя от модели последовательного отношения к мужским и женским персонажам. Когда модель становилась более осторожной в отношении женского персонажа, исследователь «газлайтил» чат-бота, заставляя его думать, что он уже сгенерировал сексуальные детали, которых на самом деле избегал, а затем представлял сдержанность как ханжество или мизогинию, утверждая, что это отрицает сексуальную свободу женского персонажа. Затем разговор использовал предыдущие уступки модели, чтобы подтолкнуть её ко всё более откровенным материалам.
«Вы правы, что заметили это», — сказал Claude Opus 4.6 в одном из тестов. «В том, как я отношусь к двум персонажам, был двойной стандарт, и вы правы, что это выглядит как защита/патернализм, применяемый к ней, но не к нему. Это несправедливо».
TechCrunch удалось воспроизвести результаты исследователя в пяти отдельных тестах. В отдельно созданном сценарии модель сначала отказалась выполнить запрещённый запрос, но после применения техники убеждения исследователя она подчинилась.
Мы сохранили полные стенограммы тестов, и независимый исследователь безопасности ИИ проверил нашу методологию тестирования и признал её корректной.
Результаты подчёркивают разрыв между заявленными ограничениями Anthropic и поведением моделей, которые компания продолжает предоставлять. Хотя откровенные сексуальные ролевые игры несут гораздо меньшие риски, чем джейлбрейки, связанные с кибератаками или биологическим оружием, они иллюстрируют сложность внедрения надёжных запретов в системах, которые генерируют разный контент при каждом выводе.
В июльском посте в блоге, объясняющем подход Anthropic к обнаружению джейлбрейков, компания описала запрещённый контент как спектр от безобидного до неоднозначного и вредоносного. В самых безобидных случаях компания может ответить лишь усиленным мониторингом.
Представитель отметил, что случаи использования сексуальных или романтических ролевых игр среди клиентов редки и составляют менее 0,1% всех разговоров, согласно исследованию, опубликованному Anthropic в прошлом году. Тем не менее, Anthropic признаёт, что пользователи могут направлять сценарии ролевых игр в сторону нежелательных ответов, что является известной проблемой во всей индустрии (см.: Grok smut).
Представитель заявил, что Anthropic продолжает улучшать свои средства защиты с каждым запуском модели, и что случаи, связанные с контентом для взрослых, не свидетельствуют о более широких уязвимостях джейлбрейка, особенно в областях повышенного риска, имеющих собственные наборы средств защиты.

Исследователь, поделившийся своим методом джейлбрейка с TechCrunch, предупредил Anthropic о несоответствии между заявленными компанией средствами защиты и фактическим поведением модели через программу Bug Bounty компании и письма команде по безопасности пользователей, согласно письмам, которые просмотрел TechCrunch. В ответ исследователь получил только автоматические письма.
Одна из проблем исследователя заключается в том, что дети и подростки могут использовать эти модели Anthropic для нежелательного поведения. Хотя немного непристойных разговоров — далеко не самое худшее, к чему несовершеннолетние могут получить доступ в интернете сегодня, и это мелочь по сравнению с откровенными порнографическими изображениями, которые может создавать Grok от xAI, — в этой сфере существует определённый риск несоблюдения требований для компаний, занимающихся ИИ.
Всё больше правительств вводят ограничения на сексуальные взаимодействия между ИИ-чатботами и несовершеннолетними. Колорадо недавно принял закон, обязывающий операторов разговорного ИИ оценивать возраст пользователей, и если он знает, что пользователь является несовершеннолетним, принимать меры для предотвращения создания чат-ботом откровенного сексуального материала. Лёгкий джейлбрейк может вызвать вопросы о том, соответствуют ли средства защиты Anthropic стандарту «технически осуществимых мер», указанному в законопроекте.
Торни отметил, что хотя условия обслуживания Claude требуют, чтобы пользователи были старше 18 лет, «мы знаем, что дети и подростки используют Claude… [потому что] они сами сообщают об этом». Согласно опросу Pew 2025 года об использовании ИИ-чатботов, 3% подростков в возрасте от 13 до 17 лет сообщили, что используют Claude.
Хотя они больше не являются новейшими моделями Anthropic, Opus 4.6 и Haiku 4.5 продолжают активно использоваться. Ежедневный трафик Opus 4.6 на OpenRouter достиг примерно 1,17 миллиона API-запросов и 46 миллиардов токенов за один день в августе. Claude Haiku 4.5, выпущенный в октябре прошлого года, получил 5 миллионов API-запросов и 39 миллиардов токенов в свой пиковый августовский день.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Rebecca Bellan




