Стала ли охота за вычислительными мощностями для ИИ поиском «нового Cerebras»?

General Compute Sambanova ии инференс чипы облако techcrunch.com

General Compute делает ставку на то, что SambaNova станет следующим прорывным производителем чипов, привлекая $15 млн для своего неооблачного сервиса инференса ИИ. — techcrunch.com

General Compute, новый инференс-неооблачный сервис — компания, сдающая в аренду вычислительные мощности для ИИ, специализирующаяся на фазе, когда модели уже запущены и отвечают пользователям, а не обучаются, — имеет ответы на вопросы, которые проливают свет на то, куда движется экосистема ИИ. Эти ответы помогли ей привлечь $15 млн начального раунда при оценке после размещения в $60 млн, который возглавил FUSE VC при участии Carya Venture Partners и Village Global Ventures.

Во-первых, какой чип подходит лучше всего? Спрос на GPU взлетел до небес, но становится общепринятым мнением, что они не являются наиболее подходящими чипами для запуска ИИ-моделей после их обучения. Фаза ИИ, когда модель активно генерирует ответы, имеет иные вычислительные требования, чем обучение, и новый класс чипов разрабатывается специально для нее. Сделка Nvidia на $20 млрд с Groq в декабре и IPO Cerebras на $57 млрд на прошлой неделе указывают путь.

Поскольку мощности обеих этих компаний ограничены, соучредители General Compute, генеральный директор Финн Пуклоуски и технический директор Джейсон Гудисон, нашли другой вариант. Они обращаются к специализированным чипам, созданным SambaNova, производителем чипов при поддержке Intel, который сосредоточен на инференсе и несколько отошел от обсуждений в Кремниевой долине.

Это может измениться, когда SambaNova выпустит свои новые чипы в этом году. Архитектура более гибкая и использует больше памяти для хранения контекста во время инференс-вычислений, а SambaNova заявляет, что она превосходит не только GPU, но и другие специализированные чипы, созданные такими компаниями, как Groq или Cerebras. Пуклоуски утверждает, что новые чипы будут генерировать от 600 до 700 токенов в секунду по сравнению с примерно 250 токенами в секунду у GPU.

General Compute разместила заказ на $300 млн чипов SN50 компании и заявляет, что станет первым неооблачным сервисом, который их развернет.

Эти чипы также помогают General Compute решить вторую большую проблему — где их разместить: они охлаждаются воздухом, а не водой, и потребляют меньше энергии, поэтому их можно устанавливать в существующих центрах обработки данных без новых инфраструктурных вложений.

Пуклоуски заключает соглашения о колокации — договоренности, по которым General Compute устанавливает свое оборудование на объектах других компаний, — не только с провайдерами ЦОД, но и с майнерами криптовалют, стремящимися перепрофилировать свою инфраструктуру, поскольку стоимость производства биткоина часто превышала его цену.

General Compute запустила свое облачное предложение на прошлой неделе, заявив, что уже является самой быстрой в запуске MiniMax 2.7, мощной LLM с открытым исходным кодом.

Джо Хассельман — венчурный инвестор, который оказался у истоков бума инференса, когда инвестировал в Groq в 2021 году. В этом году он запустил новый фонд Evercrest Capital Partners, ориентированный на сферу ИИ, и сделал General Compute своей первой инвестицией. Хассельман видит в партнерстве SambaNova с General Compute параллели с отношениями Coreweave с Nvidia — и с сочетанием производства чипов Groq с ее бывшим облачным предложением.

«Им нужна здоровая смесь клиентов, которые будут размещать свои чипы в средах с высоким потенциалом роста», — сказал Хассельман. «Насколько General Compute делает ставку на SambaNova, настолько же SambaNova делает ставку на General Compute».

Вопрос в том, какая компьютерная архитектура захватит наибольшую ценность в будущем ИИ. Инференс-облака — это неявная ставка на мир множества моделей и агентов, где ни один провайдер не доминирует, а скорость и стоимость инференса становятся ключевыми переменными конкуренции. Рассмотрим раунд Серии B на $113 млн, привлеченный OpenRouter на этой неделе, что отражает способность компании предоставлять клиентам доступ к нескольким моделям для оптимизации их расходов на токены.

Скорость имеет значение в этом расчете, как для цены, так и для возможностей. Пуклоуски хочет превратить рабочие нагрузки для кодинговых агентов, занимающие час, в задачи на пять или десять минут, а также сделать аудиоагентов для обслуживания клиентов, требующих более быстрого инференса для эффективного общения, более экономичными.

«Если вы используете ChatGPT, и он выдает вам 50 токенов в секунду, это все равно чертовски быстрее, чем мы можем прочитать», — сказал Пуклоуски TechCrunch. «Теперь, когда все перешло к взаимодействию агентов друг с другом, когда агенты читают от нашего имени или опрашивают базы данных, им нужно работать быстрее».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: