Антропик Opus 5 — эффективность токенов, а не скачок возможностей

Anthropic Opus 5 ии-модели кодинг стоимость конкуренция arstechnica.com

Anthropic выпустила Opus 5 — модель для кодинга, почти не уступающую Fable, но вдвое дешевле. Узнайте, как она справляется с бенчмарками и почему конкуренция с открытыми моделями обостряется.

Сегодня Anthropic выпустила Opus 5 — новейшее обновление модели, которая в последнее время стала популярным выбором для написания кода и других задач разработки ПО, помимо прочего.

Хотя это заметное улучшение для Opus, оно не выглядит прорывом уровня Opus 4.5 в агентной производительности кодинга.

График (составленный Anthropic) с различными бенчмарками, такими как Frontier-Bench и DeepSWE, показывает, что Opus 5 работает примерно на том же уровне или немного опережает широко разрекламированные возможности модели Fable от Anthropic для задач кодинга. Он якобы превосходит Opus 4.8 и конкурирующую GPT-5.6-Sol от OpenAI практически во всех типах задач.

Различные бенчмарки демонстрируют итеративное повышение производительности, но не радикальный скачок, при этом главный аргумент — это модель, которая предлагает почти то же, что и Fable, примерно вдвое дешевле.

Стоит также отметить, что Anthropic специально не давала Opus 5 передового обучения задачам кибербезопасности, поэтому в этом отношении она сильно отстает от Fable и Mythos. Anthropic утверждает, что модель относительно хорошо находит уязвимости в кибербезопасности, но из-за решений, принятых при обучении, она «существенно отстает от Mythos 5 в эксплуатации этих уязвимостей».

Таким образом, у Opus 5 нет всех тех же спорных защит, что были у Fable, например политики хранения данных для проверки в течение 30 дней на случай инцидента.

Но на самом деле это история о стоимости. От одного обновления модели к следующему мы в основном наблюдаем скромные улучшения производительности — хотя они выглядят гораздо более впечатляющими, если смотреть на весь год обновлений. Сейчас среди разработчиков ПО и инженерных менеджеров в основном обсуждается вопрос стоимости, и наблюдается реальное движение в сторону моделей с открытыми весами, локальных моделей и других альтернатив передовым frontier-моделям.

Opus 5 стоит $5 за миллион входных токенов или $25 за миллион выходных токенов — на уровне предшественника, но дешевле, чем Fable. Тем не менее, недавно анонсированная китайская модель с открытыми весами Kimi K3 стоит всего $15 за миллион выходных токенов при аналогичной производительности, так что конкуренция жесткая.

В последнее время такие компании, как Cursor и Meta*, создают «роутеры моделей» — системы, которые автоматически выбирают модели разного размера и возможностей из множества вариантов в зависимости от характера запроса. Идея в том, чтобы экономить много токенов (а значит, вычислительных ресурсов и/или денег), не используя что-то вроде Fable для каждой задачи.

Таким компаниям, как Anthropic, придется продолжать снижать стоимость токенов или хотя бы (как в данном случае) предлагать больше производительности без дополнительных затрат, чтобы сохранить наблюдаемый рост. В противном случае они начнут терять пользователей, которые перейдут на меньшие или открытые модели, как только те станут достаточно хороши для решения менее сложных задач разработки.

Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:

Похожие новости: