20 минут с CEO ElevenLabs: компания на пике искусственного интеллекта, оценка которой достигла $22 млрд

ии голос Elevenlabs технологии будущее techcrunch.com

Узнайте, как ElevenLabs меняет сферу ИИ-голоса. Генеральный директор призывает к прозрачности в общении с ИИ и делится видением будущего.

В этом оно не одиноко. На самом деле, оно все чаще сталкивается с клиентами, в том числе с Decagon, платформой разговорного ИИ, которая обучила свой голосовой продукт на ElevenLabs, а теперь конкурирует с ним. Но инвесторы, похоже, не слишком обеспокоены. Компания, которая, по ее словам, достигла годового регулярного дохода в размере 600 миллионов долларов, теперь, по сообщениям, оценивается ее спонсорами в 22 миллиарда долларов, несмотря на то, что ей всего четыре года.

Чтобы узнать больше, я взял интервью у соучредителя и генерального директора ElevenLabs Мати Станишевского на конференции Nrth в Торонто, местной конференции предпринимателей, ранее известной как Elevate. Мы успели охватить ряд тем за короткое время, в том числе вопрос о том, должны ли компании сообщать клиентам, когда они разговаривают с ИИ (он считает, что должны), и может ли он обсуждать валовую прибыль компании. Неудивительно, что Станишевский сказал, что не может обсуждать ее подробно, но ясно дал понять, что он не возражает, если она будет еще больше сжата, если это означает расширение доли рынка компании.

Наша беседа приводится ниже, в сокращенном и слегка отредактированном виде. Полную беседу можно посмотреть здесь.

Вы выступали у нас на TechCrunch Disrupt в прошлом году, где сказали, что аудиомодели станут товаром в течение пары лет. Как вы оцениваете это предсказание сейчас?

Предстоит еще много работы, и разница в качестве, которую можно достичь только на уровне модели, по-прежнему значительна. Если смотреть дальше, вероятно, через три-пять лет, эти различия будут меньше. Мы хотели бы сделать и быть первыми, кто пройдет тест Тьюринга для разговорного ИИ. Вам нужно сочетать интеллект, но также и эмоциональный интеллект. Вам нужно понимать эмоции другой стороны, чтобы иметь возможность замедлиться или ускориться. Этого еще не достигнуто.

Какой процент бизнеса сейчас приходится на корпоративный сегмент?

Сейчас у нас 600 миллионов долларов годового регулярного дохода. Пятьдесят пять процентов плюс — это классический корпоративный сегмент, а большая часть [оставшихся] 45% — это малый и средний бизнес, разработчики, создатели.

Как и все остальные в сфере ИИ, вы все больше конкурируете со своими клиентами. Decagon обучил свой голосовой продукт на вас и теперь обрабатывает запросы через свои собственные модели.

Границы становятся более размытыми. Когда мы думаем о модельных компаниях, платформенных компаниях, прикладных компаниях, в прошлом были очень четкие разделения, где одно начинается и заканчивается. Сегодня эта граница гораздо более размыта. В случае с Anthropic то, что было модельной компанией, определенно является платформой и все более широким набором приложений. Я думаю, это продолжится.

Ваши клиенты могут выбирать «слой рассуждений» из меню опций в ElevenLabs. Что вы наблюдаете в плане использования передовых лабораторных моделей по сравнению с моделями с открытым весом?

Это скорее не бинарный выбор. В клиентском опыте, если вы звоните и это просто информационный запрос, вы не выполняете никаких действий — вы можете использовать многие модели с открытым исходным кодом, потому что ваша база знаний определяет, что такое хороший опыт. Но если это финансовые услуги, вы хотите быть аутентифицированы, вам нужна информация о транзакции, возможно, возврат средств. Здесь нет места ошибкам. Здесь передовые модели по-прежнему будут лидировать.

Некоторые из этих моделей с открытым весом — китайские. Правительство США является клиентом. Европейские правительства — клиенты. Как проходят эти разговоры?

По-разному. При каждом развертывании модели и голоса, которые мы развертываем, будут зависеть от конкретного случая. Если мы работаем с польским или бразильским правительством, у них есть свой набор требований. Это может быть модель с открытым весом, модель с закрытым исходным кодом, их собственная дообученная модель. [В Польше] это случай с здравоохранением. Пациенты записываются на прием через государственную систему здравоохранения, и 18% не являются. Развертывание — это агенты, которые звонят и напоминают вам. У них был набор моделей, оптимизированных на их знаниях, и мы интегрируемся, сохраняя резидентность данных.

Должны ли компании раскрывать, когда кто-то разговаривает с агентом, а не с человеком?

Я думаю, что на данный момент должно быть раскрытие информации. В настоящее время люди к этому не привыкли, и распространенный шаблон — вы не хотите чувствовать себя обманутым во время этого звонка. Но через пять лет, когда у каждого будет свой агент, работающий от их имени, вы будете звонить и ожидать агента. Тогда мы, как общество, изменимся. Есть хорошие способы сделать это — если ожидание человека составляет 30 минут, предложите клиенту выбор. Почти во всех случаях они выбирают агента, а затем удивляются, насколько хорош опыт.

Какова ваша валовая прибыль, учитывая, сколько вы платите за модели и инференс?

Я дам расплывчатый ответ. Учитывая, что у нас есть исследовательский элемент, мы можем очень умно дообучать и ограничивать модели. Но если мы можем передать какую-либо экономию клиенту, мы делаем это. Самое главное — по-прежнему доказывать ценность и быть рядом с клиентом. Поэтому, если мы можем инвестировать и доказать эту ценность, мы не против снижения маржи, чтобы фактически получить взаимную выгоду по мере создания ценности в ближайшие пять лет.

У вас есть миллионы часов звонков в службу поддержки клиентов. Вы обучаетесь на них? Какая часть ваших обучающих данных синтетическая?

В некоторых компаниях мы создавали модели вместе. Они хотели конкретную модель для своего случая использования. В противном случае большая часть обучения заключалась не столько в объеме данных, сколько в аннотировании данных. У нас есть тысячи людей внутри компании на контрактной основе, которые помогают нам аннотировать не только то, что было сказано, но и когда люди говорили, как они говорили, какие эмоции использовались. Нам пришлось привлечь тренеров по голосу, чтобы точно определять акценты.

По сообщениям, вы планируете IPO на 2028 год. Можете ли вы это подтвердить?

Мы хотели бы создать компанию, которая выдержит испытание временем. Мы готовим фундамент, чтобы иметь возможность сделать это в ближайшие годы. Но будет ли это сделано, будет зависеть от времени и места.

«Годы» — это очень расплывчато.

[Смеется.]

За кулисами: Каково ваше мнение о том, следует ли передовым лабораториям замедлиться?

Все согласны работать вместе над поиском способа регулирования темпов. Следует ли делать это публично и сколько внимания СМИ или регулирования это должно вызывать, это другой вопрос. Но да, мы все должны принять соответствующие меры предосторожности при развертывании технологии. Мы не обучаем текстовые модели и интеллектуальную сторону моделей, что является ключевым моментом дебатов.

Может ли ElevenLabs оказаться под угрозой, как Hugging Face?

Мы на шаг впереди, потому что мы не развертываем самовоспроизводящиеся или рекурсивные части интеллекта агентов. Наша технология не позволяет агентам создавать больше агентов. Каждый клиент проходит KYC. Риск кибербезопасности, безусловно, является риском для всего мира, но у нас есть хороший набор мер предосторожности.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: