IQuest Research открывает исходный код IQuest-Q1: модель MoE на 320 млрд параметров для кодирования агентов с 15 млрд активных параметров

ии модели кодирование агенты Open Source pandaily.com

IQuest Research выпустила открытые веса для IQuest-Q1 — 320-миллиардной разреженной MoE модели с 15 млрд активных параметров, созданной для агентов кодирования в командной строке. Модель имеет контекстное окно 512K и результат 84.5 на CyberGym.

IQuest Research представила в открытый доступ IQuest-Q1 — разреженную модель Mixture-of-Experts (MoE), разработанную для кодирования агентами, рассуждений и многоэтапного использования инструментов. Модель имеет около 320 миллиардов параметров, из которых примерно 15 миллиардов активируются на токен. Веса и карточка модели были опубликованы на Hugging Face под организацией IQuestLab 28 сентября, а код для инференса — на GitHub под пользовательской лицензией IQuest-Q1.

Команда позиционирует IQuest-Q1 как базовую модель для систем командной строки на основе агентов. Согласно карточке модели, она имеет 88 трансформерных слоев, 256 экспертов с восемью активными на токен, гибридный паттерн внимания, сочетающий три слоя с раздвижным окном и один слой полного внимания, а также контекстное окно на 524 288 токенов. Слои предсказания нескольких токенов поддерживают спекулятивное декодирование. IQuest рекомендует развертывать модель с помощью SGLang или vLLM на восьми GPU и запускать ее в средах, таких как Claude Code или Codex.

Предварительное обучение и промежуточное обучение сместили данные в сторону кода и STEM, добавили траектории агентов с более длинным контекстом, а затем последовали три этапа, ориентированных на агентов. IQuest объединила задачи с их средами, включая реальные API, серверы MCP и исполняемые репозитории, и обучила одну политику на нескольких средах. Обучение с подкреплением привело к созданию четырех экспертных моделей для пользовательского опыта агентов, работы в нескольких средах, задач с длительным горизонтом и общей работы агентов, которые были объединены в одного студента посредством дистилляции на основе нескольких учителей с использованием on-policy.

По опубликованным бенчмаркам, IQuest-Q1 показывает 64,6 на DeepSWE v1.1, 63,0 на NL2Repo, 84,5 на CyberGym, 83,2 на Terminal-Bench 2.1, 55,7 на JobBench и 29,6 на Agents’ Last Exam. В сравнительной таблице она опережает GLM-5.3 и DeepSeek-V4-Pro на NL2Repo, но уступает DeepSeek-V4.1-Flash на DeepSWE и CyberGym. Результаты для других моделей — это общедоступные данные, где они имеются.

IQuest также заявляет, что модель участвовала в собственном развитии под наблюдением человека. В одном из случаев, описанных в блоге, IQuest-Q1, работая в Claude Code, выявила застой кривой вознаграждения, вызванный лишним пробелом, вставленным при декодировании текста, что привело к потере части обучающей функции потерь; после исправления среднее вознаграждение восстановилось. Исследователи сохраняли контроль над направлением исследований, дорогостоящими экспериментами и выбором версий для внедрения. Команда предупреждает, что модель является только текстовой, находится на ранней стадии разработки и требует человеческого надзора при выполнении реальных задач в командной строке.

СМОТРИТЕ ТАКЖЕ:Модель XekRung от Alibaba возглавила рейтинг CyberGym · NaiveAI N0.5-Flash 309B MoE · DeepSeek Harness v0.2: предварительный просмотр

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: