Несмотря на падение цен за токен, стремление к более широкому внедрению ИИ и растущая автономность агентов привели к тому, что потребление токенов постоянно растет. Компании, которые в начале 2025 года набрали подписки по системе «все, что можешь съесть», теперь лихорадочно пытаются понять, куда уходят их деньги, сократить расходы и выяснить, смогут ли они извлечь хоть какую-то рентабельность из обломков своих бюджетов.
Тем временем формируется рынок, чтобы удовлетворить их потребности. Стартапы, устоявшиеся поставщики и новый орган по стандартизации спешат предоставить компаниям инструменты и язык для отслеживания расходов.
«Шесть месяцев назад я разговаривал с клиентом, и все сводилось к вопросам: „Что это может делать? Достаточно ли это хорошо?“», — рассказал Александр Эмбрикос, глава отдела по работе с корпоративными клиентами OpenAI, на мероприятии TechCrunch в Нью-Йорке на этой неделе. «Теперь наши разговоры никогда не об этом. Теперь мы говорим: „Эй, мы тратим так много. Какая у вас видимость? Какая у вас возможность аудита? Какие у вас есть средства контроля токенов? Какова эффективность ваших моделей?“»
Именно на этом фоне Linux Foundation на этой неделе объявила о планах по созданию Tokenomics Foundation — нового органа по стандартизации, цель которого — привить такую же финансовую дисциплину в отношении токенов ИИ, какую FinOps привил расходам на облачные вычисления.
«В апреле и мае я начал слышать от компаний: „О боже, мы превысили наш годовой бюджет на токены 2026 года в три раза, а на дворе только апрель“», — сообщил TechCrunch Дж. Р. Стормент, исполнительный директор FinOps Foundation, проекта под эгидой Linux Foundation. «Мы начали слышать об экзистенциальных кризисах, и весь разговор сместился от tokenmaxxing и „действуй быстро“ к „нам нужны ограничители, как нам это контролировать?“»
Крики, разнесшиеся по технологическому миру, последовали за яростными требованиями генеральных директоров, подталкивающих свои команды использовать лучшие модели и действовать быстро, невзирая на затраты. Новые модели, выпущенные в ноябре, такие как Claude Opus 4.5 от Anthropic, GPT-5.1 от OpenAI и Gemini 3 Pro от Google, принесли значительные улучшения в агентурных инструментах, что многократно увеличило потребление. Именно так одна компания, по сообщениям, получила счет за Claude на 500 миллионов долларов после того, как забыла установить лимиты использования для сотрудников.
«Это похоже на эпидемию крэк-кокаина», — сказал Крис Рид, старший директор по ИТ-финансам в Priceline, отметив, что компания начала устанавливать лимиты токенов для определенных групп. «Они позволяют вам попробовать, чтобы вы подсели, а теперь вы как бы зависите от этого».
Виталий Гордон, генеральный директор платформы инженерных операций Faros AI, рассказал, что недавно общался с техническим директором, который сказал ему: «Один из моих инженеров потратил 40 000 долларов на токены в прошлом месяце, и я искренне не знаю, должен ли я его остановить или пойти и сказать всем остальным, чтобы они были как он».
Март опрос, проведенный Faros, показал, что среди 20 000 разработчиков производительность росла, но вместе с ней росли и ошибки, и необходимость переписывать код. Jellyfish, платформа управления разработкой, аналогичным образом обнаружила, что инженеры, использующие больше всего токенов, были примерно в два раза продуктивнее тех, кто использовал ИИ меньше, но для этого им потребовалось в 10 раз больше токенов.
Николас Арколано, руководитель отдела исследований в Jellyfish, сообщил TechCrunch по электронной почте, что расходы на ИИ взрывообразно растут во многом из-за агентурных функций: потребление на одного разработчика выросло примерно в 18,6 раза за девять месяцев. В целом, эти статистические данные делают аргумент о производительности более туманным, чем предполагают расходы.
«Окупаются ли экстремальные траты, зависит от конечной бизнес-ценности выпущенного кода (например, выручки), которую большинство компаний до сих пор не могут измерить», — сказал Арколано.
По крайней мере, часть этой проблемы измерения связана с масштабом, в котором сегодня используется ИИ.
«Отслеживание расходов на облачные вычисления — это проблема данных с сотнями миллионов строк в месяц», — сказал Стормент. «Отслеживание расходов на токены — это проблема данных с триллионами строк в месяц. Вы не можете просто засунуть это в какую-то электронную таблицу или даже базовый инструмент. Вам нужно фундаментально переосмыслить свои инструменты, спецификации и системы учета, чтобы сделать это».
В Priceline Рид уже видит расхождения. Он отметил проблемы между данными об использовании, предоставленными поставщиком, и внутренними данными Priceline.
«Я начинал свою карьеру в сфере управления расходами на телекоммуникации, и я вижу все те же параллели: от телекоммуникаций до облачных вычислений и ИИ», — сказал он. «Всякий раз, когда вы вводите что-то новое, это благодатная почва для ошибок в выставлении счетов, а также для возможностей аудита и оптимизации».
Вокруг этой проблемы начинает формироваться рынок. Есть компании, работающие в узкой нише, такие как Pay-i, которая отслеживает, измеряет и оптимизирует затраты и производительность инвестиций в GenAI. Paid, тем временем, позволяет разработчикам отслеживать расходы, измерять использование и выставлять счета пользователям на основе фактической ценности, а не абонентской платы.
Затем есть такие компании, как Jellyfish, Waydev и Faros AI, которые предоставляют мониторинг агентов ИИ для доказательства рентабельности инструментов для разработчиков. Стормент говорит, что большинство из 180 поставщиков в FinOps Foundation склоняются к этой области.
Компании с существующей дистрибуцией также добавляют новые функции, чтобы извлечь выгоду из этого нового рынка. Ramp недавно перешла к управлению расходами на ИИ; Datadog и New Relic добавили такие услуги, как управление расходами на облачные вычисления, наблюдаемость на уровне токенов и мониторинг GPU. На следующей неделе на конференции FinOps X ожидается, что AWS представит новые функции финансового управления, ориентированные на корпоративные расходы на ИИ.
Тиффани Лак, партнер NEA, считает, что эффективность токенов и наблюдаемость, вероятно, будут добавлены на «уровень управления или приложений». Она указала на Factory, стартап, который создает агентов ИИ для предприятий и который на этой неделе выпустил маршрутизатор моделей, автоматически выбирающий нужную модель для каждой задачи.
Гордон ожидает, что передовые лаборатории и другие поставщики моделей примут оптимизацию в стиле OpenRouter для направления запросов к самым дешевым моделям — тенденция, которая уже проявляется в корпоративных счетах за Claude.
«В финансовом отчете о том, сколько вы тратите на Anthropic, даже если вы вызываете модель Opus, часть расходов придется на Sonnet или Haiku, потому что они достаточно умны, чтобы это сделать», — сказал Гордон. «Я думаю, это будет становиться все более распространенным явлением».
Но все эти инструменты создаются без общего языка или единых определений того, сколько стоит токен, что он производит и как сравнивать расходы между поставщиками. Именно здесь Tokenomics Foundation надеется оказаться полезным.
Фонд разрабатывает каноническое определение и структуру для «токеномики»; открытые стандарты, спецификации и метрики для использования токенов ИИ и выставления счетов; а также новые метрики для экономики ИИ, такие как стоимость на единицу интеллекта или токены на ватт. Он также планирует определить метрики эффективности фабрик токенов и эффективности потребления. Группа планирует официальный запуск в июле и собирается объявить о новых членах на конференции FinOps X на следующей неделе.
«Экономика токенов по своей сути более абстрактна и непрозрачна, чем все, чем мы управляли в таком масштабе раньше», — заявил Нишант Гупта, директор по доступности в Salesforce. «Это требует иной операционной сноровки, чем та, которую отрасль выработала для облачных вычислений».
Тем не менее, Goldman Sachs прогнозирует, что к 2030 году глобальное использование токенов увеличится в 24 раза. Компании, уже превысившие бюджеты, нуждаются в решениях сейчас, а первый результат работы фонда будет готов лишь через несколько месяцев.
«Возможно, мы создали паровой двигатель, но мы еще не наладили конвейер», — сказал Гордон.
По словам Арколано, разумный подход — это широкое, умеренное внедрение.
«Наилучшая рентабельность достигается за счет перевода широкой середины от низкого к умеренному использованию, а не за счет увеличения использования у тех, кто и так использует много», — сказал он.
В подготовке этого материала приняли участие Рассел Брэндом и Тим Фернхольц.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Rebecca Bellan




