Вечером 26 августа команда Qwen из Alibaba выпустила Qwen3.8-Flash — открытую мультимодальную модель на основе смеси экспертов (MoE), которая описывается как техническая предварительная версия архитектуры следующего поколения Qwen4. Название по-прежнему содержит тег 3.x, но конструкция является новым поколением, выпущенным досрочно, чтобы сообщество могло проверить архитектуру до выхода полного семейства Qwen4.
Главное — стоимость. Основная модель имеет 125 миллиардов параметров с дополнительным модулем N-граммовых эмбеддингов на 51 миллиард параметров, но на каждый токен активируется только около 6 миллиардов параметров. Там, где плотная модель задействует каждый параметр для каждого токена, архитектура MoE вызывает только соответствующих экспертов, сохраняя низкие вычислительные затраты. Нативный контекст составляет 262K токенов, расширяемый до 1 миллиона с помощью YaRN.
Alibaba сообщает, что стоимость обучения составляет примерно одну девятую от Qwen3.7-Plus, при этом результаты в задачах кодирования и офисных задачах выше. Показатели включают 58,7 на DeepSWE 1.1, 62,5 на SWE-bench Pro и 84,5 на AndroidWorld, превосходя порог, установленный эталонным тестом DeepSeek V4 Flash. Цены API следуют низкой стоимости: 0,13 евро за миллион входных токенов и 0,38 евро за миллион выходных токенов — примерно треть от V4 Flash, без разделения на пиковые и непиковые периоды.
С архитектурной точки зрения внимание использует гибрид GDN-plus-QSA — GDN сжимает историческую информацию, в то время как QSA фильтрует важный контекст с высокой детализацией через легковесный индексатор. На последовательностях из 1 миллиона токенов ядро внимания QSA достигает ускорения до 7,6x и 4,9x на этапах предварительного заполнения и декодирования. N-граммовые эмбеддинги могут быть выгружены в память хоста и асинхронно предварительно загружены, а при обучении используется оптимизатор Muon с пересмотренным законом масштабирования.
Веса были открыты в 23:00 по пекинскому времени на Hugging Face и ModelScope, вместе с FP8-квантованной версией, которая снижает порог для локального развертывания. Alibaba выпустила его как Qwen3.8-Flash-Next, явно позиционируя как прототип Qwen4, предназначенный для сбора отзывов сообщества до выхода полного семейства, и он поставляется на платформе Qwen AI с контекстом по умолчанию в 1 миллион токенов и встроенными инструментами, дебютируя в новом офисном продукте.
Для разработчиков досрочный выпуск — это возможность адаптироваться к архитектуре Qwen4 до выхода полного семейства и получить преимущество первопроходца, в то время как агрессивное ценообразование — выход примерно по одной тридцатой от многих передовых зарубежных моделей — открывает варианты использования, которые ранее были нерентабельными, от обработки длинных документов до агентных нагрузок и пакетной обработки данных.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




