БайтДэнс выпускает Seed Audio 1.0: аудиогенеративную модель с точным временным управлением для создания звука кинематографического качества

Seed Audio 1.0 Bytedance ии-аудио оркестровка 20+ языков звуковые эффекты pandaily.com

Познакомьтесь с Seed Audio 1.0 от ByteDance — моделью для создания аудио, которая объединяет речь, звуковые эффекты и фоновый шум в единой оркестровке. Точный контроль времени и поддержка более 20 языков. Ускорьте производство аудиоконтента до профессионального уровня.

Команда ByteDance Seed выпустила Seed Audio 1.0 — комплексную модель создания аудио, которая объединяет генерацию речи, звуковых эффектов и фонового шума в едином фреймворке для создания аудиоконтента кинематографического качества «под ключ». Модель знаменует выход ByteDance в сферу генерации аудио с помощью ИИ, присоединяясь к конкурентной области, включающей ElevenLabs text-to-speech и Meta* AudioBox, с особым акцентом на точный временной контроль и оркестровку множества элементов в рамках одного цикла генерации.

Ключевое техническое новшество — унифицированная временная оркестровка. Один запрос может одновременно задать диалог с определенной эмоциональной подачей, точные звуковые эффекты, синхронизированные с событиями повествования, и фоновый шум, создающий обстановку и настроение, — все это выстроено вдоль общей временной шкалы. Это устраняет традиционный постпроизводственный процесс, при котором речь, звуковые эффекты и фоновое оформление генерируются отдельно и сводятся вручную. Модель выдает готовую аудиодорожку, где все элементы уже выровнены по заданному времени, что значительно сокращает циклы итераций в профессиональном производстве аудио.

Seed Audio 1.0 сохраняет согласованность персонажа при длительной и многоэтапной генерации. Один и тот же голос может естественно выражать разные эмоции и стили речи, сохраняя узнаваемую вокальную идентичность. Многоязычная поддержка охватывает более 20 языков с естественным произношением, ритмом и паттернами выражения для каждого языка — это необходимо для глобальной контентной экосистемы ByteDance, включающей Douyin, TikTok и международные рынки. В субъективных AB-оценках модель продемонстрировала значительные преимущества по качеству тембра, удобству использования и частоте отличных результатов по сравнению с аудиомоделями предыдущего поколения.

Модель достигает более 90% готовности аудио в большинстве сценариев оценки, охватывающих кино, телевидение, короткие сериалы, аниме, подкаст-диалоги, прямые трансляции, онлайн-создание контента, театр и синтез речи. В тестах естественности многоязычного аудио большинство языков получили оценку выше 4,0 MOS, что свидетельствует об отличном качестве аудио. Следование сложным инструкциям по генерации аудио показало оценку выше 3,5 MOS для всех протестированных языков, кроме вьетнамского. Эти результаты говорят о том, что Seed Audio 1.0 достигла производственного уровня возможностей в широком спектре сценариев создания контента, что потенциально может привести к значительной демократизации профессионального производства аудио.

Seed Audio 1.0 теперь доступен на платформе Seed Experience. Этот релиз сигнализирует о расширении ByteDance за пределы текстовых и визуальных ИИ-моделей в аудиосферу, где компания уже обладает значительным опытом благодаря своим платформам коротких видео Douyin и TikTok, которые стимулировали инновации в области поиска музыки, аудиоэффектов и создания голосового контента. В сочетании с существующими инвестициями ByteDance в генерацию видео, длинные текстовые модели и инструменты для ИИ-кодирования, Seed Audio 1.0 представляет собой еще один строительный блок в все более комплексной экосистеме создания контента с помощью ИИ от ByteDance.

Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:

Похожие новости: