Компания MindLab, одна из самых заметных NeoLabs в Китае, выпустила Macaron-V1 — пост-обученную модель на базе Zhipu AI GLM 5.2, которая демонстрирует, как целенаправленная донастройка с использованием RL на минимальных вычислительных ресурсах способна существенно повысить возможности существующей модели. Флагманский вариант Venti с 748 млрд параметров и нативным контекстом в 1 млн токенов использует четыре независимых LoRA-эксперта по 1 млрд параметров, охватывающих области Chat, Agent, Coding и UI. Каждый эксперт обучается в изолированном адаптерном пространстве с помощью собственной технологии Mixture-of-LoRA, которая предотвращает интерференцию способностей, характерную для многозадачного пост-обучения.
MoL представляет собой фундаментальный сдвиг по сравнению с традиционной донастройкой. Стандартное многозадачное пост-обучение страдает от эффекта качелей, когда улучшение одной способности приводит к ухудшению другой. Решение MindLab монтирует несколько независимых LoRA-экспертов поверх замороженной базовой модели, каждый из которых оптимизируется в собственном адаптерном пространстве с полной изоляцией. Маршрутизатор (Router Tool) выбирает подходящего эксперта для каждого запроса, а новые способности можно добавлять, просто подключая ещё одного LoRA-эксперта без переобучения существующих. Этот подход был впервые опробован на Kimi K2 с использованием 64 GPU H800, что подтвердило: RL для моделей с триллионом параметров достижимо на скромном оборудовании, если нацеливаться только на 0,5% основных параметров.
Технические инновации не ограничиваются MoL. Macaron-V1 включает технологию LongStraw, расширяющую нативный контекст GLM 5.2 до 2 млн токенов за счёт повторного использования общих подсказок-сегментов в качестве постоянного состояния, что кардинально снижает накладные расходы для длинных последовательностей. Лёгкий вариант Tall с 35 млрд параметров ориентирован на локальное развёртывание на базе Qwen 3.6. Совместно были обучены три вспомогательные системы: GenUI — для рендеринга интерактивных представлений помимо текстового вывода; REPL Harness — обеспечивающая постоянную среду выполнения Python, позволяющую моделям писать и продвигать инструменты в глобальные утилиты, доступные между сессиями; и инфраструктура обучения MinT, разработанная для MoL, где Actor и Learner обмениваются только адаптерами, а не полными весами, поддерживая каталоги адаптеров на уровне миллионов при масштабе в триллион параметров.
MindLab также создала два собственных оценочных бенчмарка. Macaron ChatBench оценивает честность агента в сценариях с длинным контекстом: признаёт ли модель пробелы, а не выдумывает ответы. Macaron LivingBench моделирует динамическую песочницу с тремя взаимодействующими механизмами — динамическим шумом, динамической средой и динамическим пользователем — измеряя, способна ли модель непрерывно понимать потребности пользователя, проверять точность информации, перепланировать пути выполнения задач и завершать их до того, как терпение пользователя иссякнет. На стандартных бенчмарках Macaron-V1 достигает скорости генерации 320 токенов в секунду, что значительно быстрее сопоставимых моделей, хотя это может быть связано с низкой нагрузкой на вывод во время раннего тестирования.
Macaron-V1 демонстрирует, что возможности китайского ИИ теперь определяются не только масштабом обучения базовой модели, но и эффективностью пост-обучения. Достижение MindLab на 64 GPU подтверждает возможность вычислительно-эффективной специализации. По мере того, как базовые модели сближаются по качеству, конкурентная дифференциация смещается на уровень пост-обучения, где техники MoL могут определить, какие экосистемы привлекут наиболее способные приложения.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




