Стартап попал на главную страницу Hacker News в мае с технологическим превью, цель которого — доказать, что «чрезвычайно быстрое декодирование одного запроса возможно на стандартных датацентровых GPU, которыми предприятия уже владеют» — например, на AMD MI300X и NVIDIA H200, которые использовались в демонстрации.
Некоторые были разочарованы, узнав, что это не распространяется на GPU в наших ноутбуках, но другие увидели потенциал. Поскольку скорость инференса и затраты стали критическим узким местом, обещание Kog открыть новые возможности на существующем оборудовании с помощью оптимизации ПО привлекло не только зевак. «У нас было 200 реальных коммерческих лидов», — рассказал TechCrunch генеральный директор Гаэль Делалло.
Основываясь на ранних отзывах, основатель-одиночка ожидает, что первым сценарием использования станет разработка ПО. Опытные пользователи Claude Code хорошо знают, что иногда им приходится ждать результатов часами. Сама Anthropic понимает, что скорость стоит денег, и взимает повышенную цену за быстрый режим Claude.
Kog надеется привлечь клиентов, которых отпугивают эти задержки, — обычно это те, кто использует ИИ-воркфлоу для профессиональных задач. Но у стартапа также есть партнеры по дизайну, которые позволяют пользователям генерировать игры и приложения с помощью подсказки, и для которых более быстрый результат благодаря Kog Inference Engine (KIE) означал бы больший доход, сказал Делалло.
Компания осознает, что этот рынок еще не вполне зрелый. Наблюдая за спросом, Kog выяснила, что ее потенциальные клиенты не готовы дообучать маленькие модели. «И именно поэтому с момента запуска мы полностью сосредоточились на ускорении разработки более крупных моделей, чтобы удовлетворить наблюдаемый спрос».
Это оставляет Kog огромный разрыв, который нужно преодолеть, чтобы выполнить обещание «30-кратного ускорения LLM-инференса». В демонстрации была показана впечатляющая скорость 3000 токенов в секунду (TPS) на запрос — но с использованием специально созданной маленькой модели всего с примерно 2 миллиардами параметров, теперь открытойLaneformer 2B.
Вопреки скептикам, Делалло уверен, что тот же подход может сработать и с LLM, чей размер может быть проблемой для чипов инференса. «У GPU есть светлое будущее», — сказал он. Для генерального директора Kog идея о том, что они плохо подходят для декодирования, стала заблуждением; новые GPU обладают все большей пропускной способностью памяти, которую только и ждут, чтобы ее раскрыли.
Kog не одинока в мысли, что программная оптимизация может помочь GPU делать больше, чем заявлено. ZML, также из Франции, выпустила аппаратно-независимое ПО, которое обходит Nvidia CUDA для поддержки быстрого инференса на конкурирующих чипах. Но Делалло сказал, что Kog ближе к лаборатории Стэнфордского университета Hazy Research с еще более глубоким фокусом на ускорение GPU.
Сам Делалло не является исследователем, и его первый стартап, участник TechCrunch50 2009 года Stribe, не имеет ничего общего с его новым — за исключением его бывшего сооснователя, ставшего венчурным инвестором, Камеля Зеруаля, чей фонд Varsity VC стал со-лидером посевного раунда Kog. Но глубокий технический фокус стартапа проистекает из его уникального бэкграунда.
Изучив физику твердого тела во французской École Polytechnique, он затем работал в сфере наступательной кибербезопасности — также известной как белое хакинг. По словам Делалло, это сформировало образ мышления, который он сейчас прививает своей команде. С научной стороны, «это образ мышления, направленный на понимание законов физики и законов GPU, чтобы выжать из них максимум».
Что касается хакинга, четырехкратный финалист турнира CTF на DEF CON сказал, что это научило его «проводить реверс-инжиниринг на очень низком уровне — вплоть до ассемблера и бинарного кода — чтобы понять, как это работает, и попытаться использовать это для достижения цели, для которой оно не обязательно было предназначено».
Обратная сторона этого подхода — он очень практический и трудоемкий. «Для каждого нового GPU мы будем тратить несколько недель или даже месяцев, чтобы действительно погрузиться в детали и провести инженерное исследование GPU на этом оборудовании». Имея команду из 11 человек, это ограничивает количество чипов, с которыми Kog может работать, по крайней мере в обозримом будущем.
В более долгосрочной перспективе Kog надеется внедрить свою методологию в агентные пайплайны, которые позволят ей поддерживать больше чипов и моделей. Поскольку Европа стремится нарастить собственные возможности в этих двух направлениях, это может добавить стартапу попутный ветер в виде суверенитета; он уже поддерживается Scaleway, а также Bpifrance и программой French Tech 2030.
Но пока Kog нужно доказать миру, что ее подход работает на LLM. Это также будет ключом к привлечению дополнительного финансирования. «Как только мы внедрим нашу первую крупную модель с 10-кратным ускорением, что, я думаю, произойдет в сентябре, мы сможем начать демонстрировать привлечение клиентов и на этом основании привлечь раунд A», — сказал Делалло.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Anna Heim




