
Восемь триллионов токенов за один день: таков дневной объем использования DeepSeek V4 Flash в одном инструменте AI-кодинга. OpenCode сообщил, что официальный релиз потребил 8 триллионов токенов, из которых 5 триллионов пришлось на бесплатные квоты, а 3 триллиона — на платные тарифы, превысив среднесуточный показатель платформы OpenRouter примерно в 6,6 триллиона. За этим стоит изменение того, как люди используют ИИ: раньше один вопрос и ответ завершали задачу; теперь агенты читают файлы, изменяют код, запускают программы и повторяют попытки после сбоев, умножая потребление в десятки или сотни раз. Один пользователь создал одностраничную 3D-игру с помощью Claude Opus 5, получив один HTML-файл, который потребил 690 миллионов токенов на сумму почти 3000 юаней.
Агентские задачи изменили способ демонстрации ценности моделей: единица измерения сместилась с того, насколько умен один ответ, на то, сколько стоит длинная задача. Один миллион выходных токенов стоит 2 юаня от DeepSeek против 25 долларов США (около 170 юаней) за Claude Opus 4.8 — разрыв в 85 раз. В Artificial Analysis Intelligence Index v4.1 V4 Flash Max набрал 50 баллов против 56 у Opus Max, но выполнение оценки обошлось в 72,02 доллара США против 3752,55 доллара США: Opus получил 6 баллов при примерно 52-кратной стоимости вызова. V4 Flash пока не может доказать полное превосходство, но как только обе модели попадут в один список кандидатов, 85-кратный разрыв изменит выбор по умолчанию. Когда модель стоит в десятки раз дороже при опережении на несколько процентных пунктов, математика перестает сходиться.
Первыми страдают не самые слабые: маленькие модели по-прежнему подходят для маршрутизации, флагманы все еще справляются со сложными задачами. В неловком положении оказываются модели среднего уровня: они мощнее V4 Flash, но в десятки раз дороже и недостаточно сильны, чтобы решить то, что не может V4 Flash. Это линия отсечения DeepSeek: ей не обязательно быть сильнейшей, достаточно быть достаточно хорошей для выполнения большинства задач, используя почти двухпорядковый разрыв в цене, чтобы вытеснить более дорогие модели из вызова по умолчанию. Контекст цен: Opus по 25 долларов за миллион выходных токенов, Fable 5 по 50; китайские модели включают Qwen 3.8 Max по 36 юаней, Kimi K3 по 100, GLM 5.2 по 28.
Что позволяет продавать Maotai по цене минеральной воды? Прямая стоимость инференса на токен, на которую влияют активированные параметры, точность, внимание, KV-кэш, длина вывода, утилизация оборудования и параллелизм. V4 Flash имеет 284 миллиарда общих параметров, но активирует около 13 миллиардов на токен, с гибридным вниманием, низкоточными весами и оптимизацией кэша; при контексте в один миллион токенов вычислительная нагрузка инференса составляет около 10% от V3.2, а KV-кэш — около 7%. Серия V4 переработала внимание в механизмы CSA (сжатие, затем фокус) и HCA (полный просмотр), а DeepSeekMoE направляет каждый токен в небольшое подмножество экспертов. Стоимость услуг и коммерческое ценообразование следуют за этим. Линия отсечения переопределяет границу: производительность и цена вместе, при этом стоимость выполненной задачи становится решающим показателем.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




