Fish Audio привлекает $50M посевных инвестиций на создание AI-голосовых моделей для авторов и бизнеса

Fish Audio синтез речи инвестиции Open-Source голосовые модели стартап techcrunch.com

Fish Audio привлёк $50 млн на развитие библиотеки из 15 000 голосов. Узнайте, как стартап с 8 млн пользователей и доходом $21 млн планирует конкурировать с ElevenLabs и другими гигантами синтеза речи.

Стартап Fish Audio из Пало-Альто стремится удовлетворить все эти сценарии использования с помощью своей библиотеки из более чем 15 000 голосовых команд на естественном языке. С момента запуска в прошлом году сегодня более 8 миллионов человек используют открытые или хостинговые версии его моделей, а годовой регулярный доход компании составляет 21 миллион долларов.

Чтобы продолжить развитие на этой волне, во вторник стартап объявил о привлечении 50 миллионов долларов в рамках посевного раунда, который возглавили Coreline Ventures и Capital Today. В финансировании также приняли участие 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners и HF0.

Fish Audio начинался как небольшой проект бывшего исследователя NVIDIA Шицзя Ляо, который, разочаровавшись в невыразительных синтезированных голосах на рынке, обучил модель генерации голоса на одном GPU и выложил её в открытый доступ. Репозиторий Fish Speech на GitHub теперь имеет более 31 000 звёзд и используется независимыми разработчиками, дизайнерами видеоигр и креаторами.

За последний год компания выпустила пять моделей: четыре модели генерации речи и одну модель преобразования речи в текст. Три модели генерации речи были открыты, но последняя модель S2.1 Pro доступна только через платный API.

Fish Audio предлагает платные ежемесячные тарифы для креаторов и команд, которые открывают определённое количество минут генерации, а также функции клонирования голоса. Компания также предлагает корпоративную версию своих API и платформы, и утверждает, что такие организации, как HeyGen, Sanas и Plaud, уже используют её.

«У каждого предприятия разные сценарии использования и предпочтения. Например, такие компании, как HeyGen, которые используют наши голоса для создания AI-аватаров, хотят реалистичности; игровая студия хочет выразительный голос для своих персонажей; а компании голосовых агентов, такие как LiveKit, хотят более естественные и малозадержные голоса, достаточно выразительные для звонков», — сказал Цао.

Один из способов, которым стартап создал свою библиотеку голосов, — это просто просить пользователей предоставлять свои голоса для обучения моделей и выплачивать им компенсацию, если их голоса используются. Однако несколько месяцев назад это привело к проблемам: некоторые креаторы утверждали, что их голоса были загружены на Fish Audio без их согласия. У стартапа был процесс удаления контента по DMCA для решения таких проблем, но сами удаления занимали много времени.

Генеральный директор и сооснователь Fish Audio Рисса Цао рассказала TechCrunch, что компания теперь автоматизировала процесс удаления. Креаторы могут легко отправить короткий образец голоса или контракт, чтобы доказать, что загруженный голос принадлежит им, и их голос будет удалён с платформы стартапа менее чем за 3 минуты, сказала она.

Тем не менее, это не мешает никому загружать голос артиста без его ведома. И пока артист не узнает об этом, его голос будет продолжать использоваться на платформе, пока он не подаст заявку на удаление.

Оскуэ Хонда, партнёр Coreline Ventures, отметил, что модель, основанная на сообществе, работает только тогда, когда креаторы доверяют платформе.

«Подход, ориентированный на сообщество, может стать устойчивым преимуществом только в том случае, если креаторы доверяют платформе. Это означает, что согласие, прозрачность и атрибуция должны быть встроены в продукт, а не рассматриваться как запоздалая мысль. Я считаю, что индустрия должна двигаться к верифицированному владению голосом, чётким условиям лицензирования, простым процессам сообщения и удаления, а в конечном итоге — к моделям распределения доходов, когда креаторы получают финансовую выгоду, если их голоса лицензируются или используются в коммерческих целях», — сказал он.

Цао сказала, что когда стартап предлагал свой продукт только как open-source проект с планами для креаторов, он работал эффективно и не нуждался в деньгах. Но он хотел разрабатывать более продвинутые модели, а также обслуживать предприятия по мере роста интереса инвесторов, что и привело к поиску капитала.

В будущем Fish Audio планирует выпустить модель понимания аудио в этом году. Также разрабатывается модель преобразования речи в речь.

Рынок генерации речи переполнен: такие компании, как ElevenLabs, WellSaid, Cartesia, Speechify, Async (ранее Podcastle) и Krisp конкурируют за кошельки креаторов и предприятий.

По словам Рико Маллоцци, партнёра 359 Capital, тонкие настройки для разработчиков и экономически эффективное обучение моделей помогут Fish Audio лучше конкурировать с крупными AI-лабораториями.

«Я считаю, что то, что им удалось создать — современные модели — с той командой, которая у них есть, по сравнению с некоторыми другими хорошо финансируемыми AI-лабораториями или компаниями, просто невероятно. Это демонстрирует их техническое мастерство в сокращении разрыва между искусственно звучащими и человеческими голосами», — сказал Маллоцци TechCrunch по телефону.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: