Во вторник компания Anthropic публично выпустила Claude Fable 5 — свою первую модель «класса Mythos», которая, по утверждению компании, превосходит предыдущие флагманские модели Opus по общим возможностям. Однако запуск модели сегодня сопровождается мерами безопасности, разработанными для предотвращения ответов на запросы по таким темам, как кибербезопасность, биология и химия, в отношении которых компания публично выражала обеспокоенность по поводу ее потенциального влияния на «усиление» злоумышленников.
Anthropic заявляет, что Fable 5 работает на «той же базовой модели», что и Mythos 5, которая сегодня выходит из своего многомесячного периода «Mythos Preview», но только для «небольшой группы специалистов по киберзащите», признанных заслуживающими доверия в рамках существующего проекта Project Glasswing. Однако, в отличие от Mythos 5, общедоступная Fable 5 настроена на перенаправление запросов по определенным конфиденциальным темам к более ранней модели Claude Opus 4.8 и предупреждение пользователя о таком перенаправлении.

Anthropic сообщила, что настроила эти меры безопасности так, чтобы они были «строже идеальных», что означает, что система может иногда отклонять «безобидные запросы» таким образом, который, по признанию компании, может расстраивать обычных пользователей. Но Anthropic утверждает, что такие ложные срабатывания возникают менее чем в пяти процентах всех сессий при тестировании, и это оправдано, чтобы избежать ситуаций, когда Mythos могла бы оказать злоумышленникам помощь в «причинении серьезного вреда, который они не смогли бы получить из других источников».
Я не могу этого допустить, Дэйв
Тематические меры безопасности Fable 5 построены на основе системы классификаторов, предназначенных для широкого обнаружения запрещенных тем запросов, а также любых попыток обхода ограничений (jailbreak). В ходе более чем 1000 часов тестирования с участием красных команд и программы поощрения за обнаружение ошибок (bug bounty) внешние команды, по данным Anthropic, не смогли найти универсальных методов обхода ограничений для Fable 5. Новая модель также в значительно большей степени сопротивлялась автоматизированным попыткам обхода ограничений по сравнению с предыдущими моделями Claude Opus, добавили в Anthropic.
Компания заявила, что особенно обеспокоена способностью Mythos 5 выполнять «агентный хакинг», выполняя многоэтапные кибератаки со значительно большей легкостью, чем более ранние модели. Однако тестирование, проведенное Институтом безопасности ИИ Великобритании в последние месяцы, показало, что Mythos Preview показала схожие результаты с GPT-5.5 от OpenAI в наборе задач Capture the Flag, что позволяет предположить, что производительность Mythos не является «прорывом, специфичным для одной модели».
,

Среди обычного набора умеренных улучшений по бенчмаркам, которые Anthropic сообщает для Mythos 5 по сравнению с предыдущими флагманскими моделями, компания заявляет о значительном скачке в возможностях модели в тесте ExploitBench, ориентированном на кибербезопасность. Mythos 5 набрала 78 процентов в тестах на уязвимые эксплойты кода, что является значительным увеличением по сравнению с 40 процентами, полученными Opus 4.8, и даже 69 процентами, достигнутыми Mythos Preview.
В то время как более ранние модели Anthropic блокировали запросы, связанные с биологическим оружием, теперь этот классификатор применяется ко всем запросам, связанным с химией и биологией, в Fable 5. Компания обеспокоена тем, что «хорошо обеспеченные злоумышленники» могут использовать даже кажущиеся безобидными запросы по этим темам для помощи в «высокорисковых биологических исследованиях» гораздо более эффективно, чем с предыдущими моделями.
Кому можно доверять?
Anthropic, похоже, понимает, что закрытие доступа к определенным темам для Fable 5 является палкой о двух концах. Компания пишет, что «те же запросы, которые полезны в руках специалистов по кибербезопасности и биологов-исследователей, могут быть опасны, если они попадут к злоумышленникам».
Это ставит Anthropic в несколько неловкое положение, когда ей приходится судить о том, кто достаточно надежен, чтобы иметь доступ к модели, которая, по ее словам, обладает потенциально опасными возможностями. Компания заявляет, что будет периодически расширять свою существующую программу Project Glasswing «по согласованию с правительством США», чтобы привлекать больше специалистов по кибербезопасности. Это расширение также будет включать новую программу доверенного доступа для организаций, занимающихся науками о жизни, которая отключает меры безопасности Fable 5 в отношении биологии/химии, сохраняя при этом меры безопасности в отношении кибербезопасности.
Пользователи API и корпоративные пользователи смогут получить доступ к модели Fable 5 по цене 10 долларов за миллион входных токенов и 50 долларов за миллион выходных токенов начиная с сегодняшнего дня. Эти цены на 67–100 процентов выше, чем цены на недавнюю GPT-5.5 от OpenAI, что может иметь существенное значение в то время, когда многие пользователи возмущены высокой стоимостью флагманских моделей.
Существующие тарифные планы Anthropic будут включать доступ к Fable 5 до 22 июня, после чего пользователям потребуется приобрести «кредиты на использование» для доступа к новой модели. Anthropic заявляет, что в конечном итоге надеется восстановить доступ к Fable 5 в качестве стандартной части тарифных планов, как только у нее будет «достаточная мощность» для этого.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Kyle Orland




