OpenBMB, подразделение ModelBest, занимающееся разработкой открытого ПО, выпустило MiniCPM5-2B — плотную языковую модель для работы на устройствах с примерно 2,52 миллиарда параметров и нативной поддержкой контекстного окна в 131 072 токена под лицензией Apache-2.0. Этот чекпойнт является вторым выпуском MiniCPM5 после MiniCPM5-1B и использует стандартную компоновку LlamaForCausalLM — 42 слоя с группированным вниманием запросов (grouped-query attention) с 16 головами запросов и 2 головами ключей/значений, что позволяет основным движкам загружать его без пользовательских ядер или форков кода модели. Количество неэмбеддинговых параметров составляет около 1,98 миллиарда, что позволяет разместить модель в классе устройств с менее чем 4 миллиардами параметров, которые могут использоваться на телефонах, ноутбуках и периферийных устройствах.
В наборе из 34 бенчмарков OpenBMB модель MiniCPM5-2B в среднем показывает результат 53,9, опережая несколько более крупных открытых базовых моделей, представленных в таблице, включая Qwen3.5-4B (51,1) и granite-4.2-3B (42,7), в то время как модели аналогичного размера, такие как LFM2.5-2.6B и Qwen3.5-2B, отстают еще больше. Сильные стороны модели сосредоточены в области кодирования, использования инструментов и извлечения информации из длинного контекста: LiveCodeBench v6 — 69,1 против 56,4 у Qwen3.5-4B, SWE-bench Verified — 46,4 против 33,6, τ²-Bench Telecom — 97,1, BFCL v4 — 66,6 и NoLiMa — 68,1 против 43,5. Показатели, связанные со знаниями, остаются ближе к верхней границе размера, с MMLU-Pro на уровне 70,8 по сравнению с 78,0 у эталонной модели Qwen объемом 4B. OpenBMB отдельно отмечает строки, основанные на Artificial Analysis, от результатов, полученных при внутреннем воспроизведении, чтобы читатели могли различать данные поставщика и сторонние показатели.
Посттренировка следует за многоуровневым управлением UltraData: глубокое обучение с дообучением под наблюдением на примерно 400 миллиардах токенов, специализированные учителя обучения с подкреплением для математики, кода, агентов и письма с использованием алгоритма JustRL II на основе критика, а затем обучение с подкреплением по стратегии (on-policy distillation), которое объединяет 16 RL-экспертов — пять из них агенты — в одного обученного студента. OpenBMB приписывает средний прирост примерно в 10,96 балла в задачах рассуждения и общих тестах и 6,96 балла в задачах, связанных с агентами, этапу RL плюс дистилляции, и выпускает промежуточные чекпойнты Base, Midtrain и SFT-only, чтобы можно было напрямую измерить вклад каждого этапа. Вместе с весами публикуются корпуса UltraData, охватывающие веб-данные, код, математику, образцы SFT для агентов и RL, для обеспечения воспроизводимости.
Поддержка во время выполнения включает vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT и сборки FlagOS для нескольких чипов, с пакетами GGUF, MLX и GPTQ, предназначенными для локальных помощников, которым необходимо поддерживать вызов инструментов и длинный контекст без использования GPU дата-центра. Для разработчиков, ориентированных на устройства, MiniCPM5-2B позиционируется не как гигант, обладающий общими знаниями, а скорее как компактный агент и помощник по кодированию под лицензией Apache, который уже превосходит некоторые открытые базовые модели объемом 4B по опубликованным средним показателям.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




