Разработчики, которые возятся с открытыми моделями, — это те же люди, которые придумывают мемы. Их любимая концепция последних месяцев — kill line, игровой термин, обозначающий момент, когда матч фактически окончен. Применительно к моделям он раньше описывал DeepSeek: новую модель сравнивают с DeepSeek по возможностям и цене, и если производительность не соответствует, а цена не падает, то обсуждать её не имеет смысла. Теперь эта линия переходит из рук в руки.
14 августа была выпущена Qwen3.8-27B, которая за два дня набрала миллион загрузок и возглавила глобальный тренд-лист Hugging Face; среди разработчиков кодинг-агента Cline она за четыре дня стала самой выбираемой локальной моделью. Artificial Analysis оценил её в 52 балла — интервал, разделяемый с GPT-5.6 Luna и DeepSeek V4 Flash, а разработчики прозвали её local Opus 4.6. Это эволюционирующая модель, которая особенно любит рассуждать, генерируя гораздо больше токенов рассуждения, чем аналоги; Саймон Уиллисон обнаружил, что на стандартном уровне она потратила 21 минуту на размышления, чтобы нарисовать пеликана на велосипеде в SVG.
Всё это не меняет главного: у неё всего 27 миллиардов параметров. Возможности, которые месяцами ранее требовали сотен миллиардов, теперь умещаются в размер, который может вместить потребительское оборудование. После 4-битного квантования веса снижаются примерно до 17 ГБ, что доступно для 24-гигабайтного GPU или устройства Apple Silicon с большим объёмом памяти. Старая дилемма заключалась в том, что то, что работало, было недостаточно умным, а то, что было достаточно умным, не работало; Qwen3.8-27B позволяет им встретиться на практическом размере. Любую новую модель теперь будут спрашивать: как она соотносится с Qwen3.8-27B?
Предыдущей kill line у DeepSeek была цена-производительность, но она по-прежнему остаётся в облаке; кодинг-агент может сжечь сотни тысяч токенов, и в середине августа DeepSeek провёл крупнейшее повышение цен с момента основания, увеличив пиковую стоимость вывода V4-Pro с 0,77 до 3,46 евро за миллион токенов (ранее 6–27 юаней). Последние два года дали ответ: при одинаковом интеллекте чьи токены дешевле? Qwen3.8-27B идёт дальше: насколько большой должна быть модель? Модель на 27 миллиардов параметров, выполняющая большую часть работы frontier-модели, меняет физическую границу развёртывания.
Прорыв имеет и технические корни. Отраслевым путём снижения затрат было MoE, которое увеличивает ёмкость, активируя лишь часть экспертов, но у MoE есть проблема, невидимая в облаке и болезненная на устройствах: неактивные эксперты всё равно существуют, поэтому необходимо хранить все веса. Так что MoE подходит для центров обработки данных, тогда как ПК, роботы и периферийные устройства заботятся о том, помещается ли модель вообще. Qwen3.8-27B плотная, поэтому эффективность исходит из архитектуры: она использует гибрид, в котором 48 из 64 слоёв применяют линейное внимание, а остальные — полное внимание, так что KV-кэш длинного контекста не расширяется с длиной последовательности.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




