General Compute, новый инференс-неооблачный сервис — компания, сдающая в аренду вычислительные мощности для ИИ, специализирующаяся на фазе, когда модели уже запущены и отвечают пользователям, а не обучаются, — имеет ответы на вопросы, которые проливают свет на то, куда движется экосистема ИИ. Эти ответы помогли ей привлечь $15 млн начального раунда при оценке после размещения в $60 млн, который возглавил FUSE VC при участии Carya Venture Partners и Village Global Ventures.
Во-первых, какой чип подходит лучше всего? Спрос на GPU взлетел до небес, но становится общепринятым мнением, что они не являются наиболее подходящими чипами для запуска ИИ-моделей после их обучения. Фаза ИИ, когда модель активно генерирует ответы, имеет иные вычислительные требования, чем обучение, и новый класс чипов разрабатывается специально для нее. Сделка Nvidia на $20 млрд с Groq в декабре и IPO Cerebras на $57 млрд на прошлой неделе указывают путь.
Поскольку мощности обеих этих компаний ограничены, соучредители General Compute, генеральный директор Финн Пуклоуски и технический директор Джейсон Гудисон, нашли другой вариант. Они обращаются к специализированным чипам, созданным SambaNova, производителем чипов при поддержке Intel, который сосредоточен на инференсе и несколько отошел от обсуждений в Кремниевой долине.
Это может измениться, когда SambaNova выпустит свои новые чипы в этом году. Архитектура более гибкая и использует больше памяти для хранения контекста во время инференс-вычислений, а SambaNova заявляет, что она превосходит не только GPU, но и другие специализированные чипы, созданные такими компаниями, как Groq или Cerebras. Пуклоуски утверждает, что новые чипы будут генерировать от 600 до 700 токенов в секунду по сравнению с примерно 250 токенами в секунду у GPU.
General Compute разместила заказ на $300 млн чипов SN50 компании и заявляет, что станет первым неооблачным сервисом, который их развернет.
Эти чипы также помогают General Compute решить вторую большую проблему — где их разместить: они охлаждаются воздухом, а не водой, и потребляют меньше энергии, поэтому их можно устанавливать в существующих центрах обработки данных без новых инфраструктурных вложений.
Пуклоуски заключает соглашения о колокации — договоренности, по которым General Compute устанавливает свое оборудование на объектах других компаний, — не только с провайдерами ЦОД, но и с майнерами криптовалют, стремящимися перепрофилировать свою инфраструктуру, поскольку стоимость производства биткоина часто превышала его цену.
General Compute запустила свое облачное предложение на прошлой неделе, заявив, что уже является самой быстрой в запуске MiniMax 2.7, мощной LLM с открытым исходным кодом.
Джо Хассельман — венчурный инвестор, который оказался у истоков бума инференса, когда инвестировал в Groq в 2021 году. В этом году он запустил новый фонд Evercrest Capital Partners, ориентированный на сферу ИИ, и сделал General Compute своей первой инвестицией. Хассельман видит в партнерстве SambaNova с General Compute параллели с отношениями Coreweave с Nvidia — и с сочетанием производства чипов Groq с ее бывшим облачным предложением.
«Им нужна здоровая смесь клиентов, которые будут размещать свои чипы в средах с высоким потенциалом роста», — сказал Хассельман. «Насколько General Compute делает ставку на SambaNova, настолько же SambaNova делает ставку на General Compute».
Вопрос в том, какая компьютерная архитектура захватит наибольшую ценность в будущем ИИ. Инференс-облака — это неявная ставка на мир множества моделей и агентов, где ни один провайдер не доминирует, а скорость и стоимость инференса становятся ключевыми переменными конкуренции. Рассмотрим раунд Серии B на $113 млн, привлеченный OpenRouter на этой неделе, что отражает способность компании предоставлять клиентам доступ к нескольким моделям для оптимизации их расходов на токены.
Скорость имеет значение в этом расчете, как для цены, так и для возможностей. Пуклоуски хочет превратить рабочие нагрузки для кодинговых агентов, занимающие час, в задачи на пять или десять минут, а также сделать аудиоагентов для обслуживания клиентов, требующих более быстрого инференса для эффективного общения, более экономичными.
«Если вы используете ChatGPT, и он выдает вам 50 токенов в секунду, это все равно чертовски быстрее, чем мы можем прочитать», — сказал Пуклоуски TechCrunch. «Теперь, когда все перешло к взаимодействию агентов друг с другом, когда агенты читают от нашего имени или опрашивают базы данных, им нужно работать быстрее».
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Tim Fernholz




