Alibaba открыла веса Qwen3.8-2.4T-A95B — первую MoE-модель класса Qwen-Max

Qwen Alibaba Moe ии модели Llm pandaily.com

Загрузите веса Qwen3.8-2.4T-A95B от Alibaba — 2,4 трлн параметров MoE с 95 млрд активных. Гибридное внимание и длинный контекст для агентов. Используйте SageMaker HyperPod и vLLM для развертывания.

Команда Qwen из Alibaba опубликовала открытые веса для модели Qwen3.8-2.4T-A95B, назвав её первой моделью класса Qwen-Max, доступной для скачивания, а не только через API. Эта разреженная модель типа «смесь экспертов» (sparse mixture-of-experts) содержит около 2,4 триллиона параметров, из которых примерно 95 миллиардов активируются на токен в 512 экспертах, при этом на каждом шаге используются 10 маршрутизируемых экспертов плюс один общий. Релиз отличается от предыдущих открытых версий Qwen, таких как Qwen-Drive и небольшие снимки кода Qwen3.8, позиционируя передовую модель MoE для самостоятельного развертывания в системах агентов и рассуждений, а не узкоспециализированную модель для восприятия или кодирования.

Архитектура основана на гибридном внимании, которое чередует вентильные линейные слои с полным вниманием в 92 слоях. Большинство слоев используют ограниченное рекуррентное состояние вместо растущего кэша ключ-значение, в то время как меньшинство сохраняет полное попарное внимание для высокоточных взаимодействий. Эта комбинация призвана обеспечить управляемость вычислений и памяти при масштабировании контекста от нативного окна около 262 тыс. токенов до примерно одного миллиона с расширением. Максимальная длина вывода указана до 128 тыс. токенов. Встроенные средства управления рассуждениями позволяют разработчикам регулировать усилия для каждого запроса, обменивая задержку на более глубокие многошаговые трассировки для рабочих процессов кодирования, исследований, анализа длинных документов и использования инструментов, которые накапливают системные подсказки, выходные данные инструментов и промежуточные планы.

Вместе с весами быстро появилось и решение для обслуживания. Amazon Web Services опубликовала руководство по SageMaker HyperPod, которое развертывает модель с использованием vLLM на экземплярах ml.p6-b300, охватывая подготовку кластера, квантование NVFP4 для размещения весов на узле с восемью GPU, вызов инструментов и нативное спекулятивное декодирование с предсказанием нескольких токенов за один раз через совместимый с OpenAI конечный узел. NVIDIA задокументировала рецепты Day-0 для SGLang, vLLM и Dynamo на GB300 NVL72, сообщив о более чем 4000 токенов в секунду на GPU и более чем 350 токенов в секунду на пользователя в FP8 в своих собственных тестах, с путями NeMo AutoModel для контролируемого или LoRA пост-обучения на контрольных точках Hugging Face. Хостинговые решения также доступны у нескольких поставщиков инференса.

Открытая контрольная точка является только текстовой и распространяется под специальной лицензией Qwen3.8-Max с коммерческими условиями для операторов крупных моделей как услуги, в то время как хостинговый продукт Qwen3.8-Max может отличаться по функциям зрения и управления режимами. Тесты, проведенные поставщиками, подчеркивают сильные стороны в исследованиях и следовании инструкциям, отмечая при этом оставшийся потенциал для более сложных задач с репозиториями. Для команд, которым требуется мощность класса Max в собственной инфраструктуре, практической новостью является комбинация скачиваемых весов и одновременных облачных решений и рецептов с открытым исходным кодом для обслуживания: модель MoE объемом 2,4 ТБ теперь может быть запущена там, где операторы уже стандартизировали vLLM и управляемые кластеры GPU.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: