Пекинский университет, Цинхуа и Alibaba открыли исходный код SparkDiffusion для ускорения генерации видео до 265 раз

ии видео трансформеры оптимизация открытый код pandaily.com

SparkDiffusion ускоряет генерацию видео Wan2.1 14B в 720P с 4769 до 18 секунд (в 265 раз) на RTX 5090, используя 97% разреженное внимание, 3-шаговую дистилляцию и FP8. Код и веса доступны.

Исследователи из Пекинского университета, Университета Цинхуа и Alibaba выложили в открытый доступ SparkDiffusion — фреймворк для ускорения видеомоделей на основе трансформеров с диффузией, ориентированный на модели Alibaba Wan 2.1 и Wan 2.2. По данным команды, генерация видео в разрешении 720P с 81 кадром (примерно пять секунд) с использованием Wan2.1-T2V-14B на одной RTX 5090 сократилась с 4 769 секунд до 18 секунд, что обеспечило 265-кратное ускорение сквозного процесса по сравнению с плотной базовой моделью с 50 шагами и классификаторно-свободным управлением. На H100 та же задача заняла от 1 757 секунд до 8 секунд, что в 220 раз быстрее.

Работа начинается с того, что авторы называют ловушкой высокой разреженности. При увеличении разреженности внимания с 90% до 97% остается только 3% блоков внимания, и на этом уровне потери при обучении продолжают падать, в то время как видео демонстрируют нарушенную структуру, дрейфующие фоны и нестабильное движение. Более длительное обучение (около 30 000 обучающих видео) и более крупные компенсационные ветви не решили проблему. Замена предсказаний плотного учителя на предсказания только для пяти шагов с наибольшим шумом устранила большую часть финальной ошибки, указывая на ранние, формирующие структуру шаги.

SparkDiffusion поэтому сначала адаптирует разреженную модель в грубый априорный модель, а затем корректирует финальное распределение выходных данных в три этапа. Короткий период начальной адаптации адаптирует модель к 97% разреженности с использованием RoLA — модуля внимания, который сочетает блочно-разреженную ветвь с низкоранговой линейной ветвью для сохранения глобального контекста. Затем CrossDistill создает трехшаговую модель-ученика, которая не требует классификаторно-свободного управления, используя один шаг согласованности при высоком уровне шума и два шага согласования распределения при низком уровне шума; при 97% разреженности она показала 83,15 балла по VBench и 58,05 по VBench-2.0, превзойдя каждую из методов по отдельности. Наконец, линейные проекции квантуются до FP8 с использованием объединенных ядер, чтобы теоретическая экономия проявилась в реальной задержке GPU.

Среди других заявленных результатов: Wan2.1-T2V-1.3B в разрешении 480P сократилось со 182 секунд до 1,3 секунды на RTX 5090, а Wan2.2-T2V-A14B в разрешении 720P — с 4 545 секунд до 25,1 секунды, что составило 181-кратное увеличение. Код доступен на GitHub под именем AlibabaResearch с лицензией Apache 2.0, а чекпоинты для преобразования текста в видео и изображения в видео в разрешениях 480P и 720P были выпущены на Hugging Face 25 сентября.

Команда планирует распространить подход на генерацию в более высоком разрешении с использованием омнимодальных моделей, авторегрессионных видео и мировых моделей, где более длинные последовательности делают ранние структурные ошибки более дорогостоящими.

СМОТРИТЕ ТАКЖЕ:Alibaba представляет Wan2.7 video · Kling AI представляет Kling 4.0 · Видеомодель Alibaba Happy Horse 1.0

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: