Команда Qwen от Alibaba представила Qwen-Image-2.1 — унифицированную модель генерации и редактирования изображений из текста, визуальный стек которой насчитывает около 7 миллиардов параметров в 32 однопоточных слоях DiT. Компания позиционирует релиз как компактную альтернативу, нацеленную на вывод изображений класса 2K, улучшенную типографику и портретное освещение, а также высокое качество при минимальных вычислительных затратах на потребительских GPU, таких как карты класса RTX 3090. Веса и демоверсии размещены на Hugging Face, ModelScope и GitHub, в отличие от недавнего релиза Alibaba Qwen3.8-Omni-Flash, который был омнимальной языковой моделью, ориентированной на аудиовизуальный чат с большим контекстом, а не на синтез пикселей.
Четыре заявленных функциональных возможности определяют его преимущества. Нативная поддержка RGBA позволяет одному и тому же чекпоинту генерировать или редактировать прозрачные слои и выделять объекты из фотографий без отдельной модели маскирования, что важно для стикеров, композитинга и готовых к печати вырезок. Редактирование поддерживает до десяти эталонных изображений для создания групповых композиций с сохранением идентичности, виртуальной примерки и рестайлинга комнат, в то время как круги, нарисованные метки или внешние маски локализуют изменения, чтобы глобальные переделки не затрагивали нетронутые области. Архитектурные решения, включая внимание с переменной гранулярностью и повторное использование префиксного KV-кэша, призваны сделать редактирование с несколькими эталонами интерактивным, а не перекодировать каждый предыдущий кадр с нуля. Поддерживаемые соотношения сторон варьируются от квадратных 2048 до сверхшироких и вертикальных телефонных форматов.
Согласно собственной таблице лидеров Qwen, команда заявляет, что генератор с 7 миллиардами параметров превосходит большинство закрытых систем обработки изображений, с которыми он сравнивался, хотя независимые публичные тесты пока редки и должны рассматриваться как заявления поставщика до тех пор, пока они не будут воспроизведены третьими сторонами. Практическая упаковка имеет такое же значение, как и результаты тестов: конвейеры Diffusers охватывают генерацию изображений из текста, редактирование и запросы в стиле стикеров RGBA, с возможностью выгрузки на CPU для более ограниченных бюджетов VRAM и генераторами с фиксированным начальным значением (seed) для воспроизводимых тестов художественного направления.
Лицензирование является коммерческим ограничением. Qwen-Image-2.1 распространяется под лицензионным соглашением Qwen Research License Agreement, которое запрещает коммерческое использование; для получения разрешения бизнес-организации должны подавать отдельную заявку. Для исследователей, независимых студий и энтузиастов открытая версия весов по-прежнему является пригодным мультимодальным стеком для работы с изображениями, который объединяет прозрачность и многоэталонное редактирование в одном пакете на 7 миллиардов параметров, вместо того чтобы требовать использования облачного API для каждого эксперимента.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




