SenseTime представила SenseNova U1.5 — модель Mixture-of-Transformers с 8 миллиардами параметров, которая объединяет понимание, рассуждение и генерацию в пиксельном пространстве в единую нативную мультимодальную систему. В отличие от конвейерных систем, которые воспринимают информацию с помощью визуального энкодера и синтезируют её через отдельный вариационный автоэнкодер, U1.5 отображает пиксели и текст в общую базовую модель без этих внешних модулей, следуя линии компании NEO-unify, одновременно улучшая пространственную реконструкцию для более высокой точности при производственных разрешениях.
Архитектурное изменение заменяет независимое декодирование MLP патчей лёгким пространственным декодером: визуальные токены преобразуются в двумерное поле признаков, затем восстанавливаются через этапы Pixel Shuffle и локальные свёртки, чтобы соседние области обменивались информацией перед финализацией пикселей. SenseTime заявила, что интерфейс по-прежнему отображает каждую область размером 32 на 32 пикселя в один визуальный токен, но поддерживает нативную генерацию до 4K с меньшим количеством швов и разрывов текстур по сравнению с предыдущей версией U1, чему способствует адаптивное к разрешению шумовое кондиционирование в более широких соотношениях сторон.
Посттренировка следует рецепту «специализация, затем унификация». Отдельные эксперты по обучению с подкреплением нацелены на визуальную эстетику, двуязычный рендеринг текста, компоновку инфографики и редактирование изображений, затем многоэкспертная дистилляция на основе политик объединяет эти навыки в одного ученика по его собственным траекториям генерации. SenseTime сообщает о более сильных результатах в открытых наборах для генерации и редактирования изображений по сравнению с U1, включая конкурентоспособный двуязычный рендеринг текста и многоссылочное редактирование, при этом сохраняя мультимодальные показатели понимания на стандартных бенчмарках STEM, VQA и OCR.
Наряду с техническим отчётом на arXiv и Hugging Face Papers, SenseTime открывает исходный код для обучения, охватывающий супервайз-файн-тюнинг, обучение с подкреплением и дистилляцию на основе политик, с активами модели, размещёнными в коллекциях SenseNova и Hugging Face под организацией OpenSenseNova. Релиз представляет собой полный стек продуктов U1.5 — а не более раннюю версию U1.5-Lite-Preview — предназначенный для разработчиков, которым нужна компактная нативная унифицированная визуальная модель, которую они могут инспектировать, дообучать и переобучать от начала до конца.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




