IQuest Research представила в открытый доступ IQuest-Q1 — разреженную модель Mixture-of-Experts (MoE), разработанную для кодирования агентами, рассуждений и многоэтапного использования инструментов. Модель имеет около 320 миллиардов параметров, из которых примерно 15 миллиардов активируются на токен. Веса и карточка модели были опубликованы на Hugging Face под организацией IQuestLab 28 сентября, а код для инференса — на GitHub под пользовательской лицензией IQuest-Q1.
Команда позиционирует IQuest-Q1 как базовую модель для систем командной строки на основе агентов. Согласно карточке модели, она имеет 88 трансформерных слоев, 256 экспертов с восемью активными на токен, гибридный паттерн внимания, сочетающий три слоя с раздвижным окном и один слой полного внимания, а также контекстное окно на 524 288 токенов. Слои предсказания нескольких токенов поддерживают спекулятивное декодирование. IQuest рекомендует развертывать модель с помощью SGLang или vLLM на восьми GPU и запускать ее в средах, таких как Claude Code или Codex.
Предварительное обучение и промежуточное обучение сместили данные в сторону кода и STEM, добавили траектории агентов с более длинным контекстом, а затем последовали три этапа, ориентированных на агентов. IQuest объединила задачи с их средами, включая реальные API, серверы MCP и исполняемые репозитории, и обучила одну политику на нескольких средах. Обучение с подкреплением привело к созданию четырех экспертных моделей для пользовательского опыта агентов, работы в нескольких средах, задач с длительным горизонтом и общей работы агентов, которые были объединены в одного студента посредством дистилляции на основе нескольких учителей с использованием on-policy.
По опубликованным бенчмаркам, IQuest-Q1 показывает 64,6 на DeepSWE v1.1, 63,0 на NL2Repo, 84,5 на CyberGym, 83,2 на Terminal-Bench 2.1, 55,7 на JobBench и 29,6 на Agents’ Last Exam. В сравнительной таблице она опережает GLM-5.3 и DeepSeek-V4-Pro на NL2Repo, но уступает DeepSeek-V4.1-Flash на DeepSWE и CyberGym. Результаты для других моделей — это общедоступные данные, где они имеются.
IQuest также заявляет, что модель участвовала в собственном развитии под наблюдением человека. В одном из случаев, описанных в блоге, IQuest-Q1, работая в Claude Code, выявила застой кривой вознаграждения, вызванный лишним пробелом, вставленным при декодировании текста, что привело к потере части обучающей функции потерь; после исправления среднее вознаграждение восстановилось. Исследователи сохраняли контроль над направлением исследований, дорогостоящими экспериментами и выбором версий для внедрения. Команда предупреждает, что модель является только текстовой, находится на ранней стадии разработки и требует человеческого надзора при выполнении реальных задач в командной строке.
СМОТРИТЕ ТАКЖЕ:Модель XekRung от Alibaba возглавила рейтинг CyberGym · NaiveAI N0.5-Flash 309B MoE · DeepSeek Harness v0.2: предварительный просмотр
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




