Об экономической сомнительности сферы ИИ написано немало, но большая часть дискуссий вращается вокруг высокоуровневых концепций вроде долей рынка, инвестиций в дата-центры и затрат на электроэнергию. Обычно от технологий ожидают, что они дешевеют по мере совершенствования, однако у ИИ-сферы есть весьма специфическая проблема: стоимость использования на самом деле взлетает, даже когда модели становятся лучше, как подробно описано в статье на VentureBeat.
При всех достижениях в моделях за последние два года наличие бота, отвечающего на вопросы простой и средней сложности, теперь не новость — все они делают это с приемлемой точностью. Агентные нагрузки — вот где кроется настоящий потенциал: ботов отпускают на многоэтапные повторяющиеся задачи, которые раньше заняли бы у человека дни, если не недели. Дайте боту доступ к вашей биллинговой системе, нескольким таблицам Excel и CRM, и попросите его, например, «кто мои прибыльные клиенты по категориям и каковы их тренды» — это становится детской забавой.
Хотя вам задать такой вопрос и получить довольно точный ответ за пару минут — пустяк, за кулисами происходит огромный объем обработки, гораздо больше, чем можно ожидать. Вычислительное время ИИ измеряется в токенах: короткий вопрос-ответ может занять от 200 до 2000 токенов, а тот, что требует от моделей поиска в интернете, — около 1000–4000. Однако агентная задача может легко потратить миллионы токенов на, казалось бы, безобидный запрос. Как? Благодаря недавно введенному термину — токеновая амплификация.
Упрощенно говоря, поскольку у модели нет памяти или когнитивных способностей, каждый раз, когда вы задаете ей очередной вопрос в разговоре, она перезагружает и обрабатывает весь обмен — всё, что вы написали, всё, что ответил бот, и все загруженные файлы. Это означает, что дополнительные вопросы в длинной беседе постепенно становятся дороже. Каждый вопрос в разговоре может сам по себе требовать всего 500 токенов, но повторная обработка всей предыдущей информации накапливается, так что второй может потратить 600, и так далее. Беседа в целом использует совокупное количество всех отдельных взаимодействий, и в качестве дополнительного штрафа: скорость ответа также имеет тенденцию замедляться по мере затягивания чатов.
Упомянутая задача генерации отчета должна выполняться поэтапно: скажем, три этапа для поиска в таблицах Excel, четыре для CRM, возможно, полдюжины веб-поисков для контекстной информации о продуктах и добрая дюжина промежуточных этапов обработки и вычислений. Каждый этап добавляет потенциально несколько тысяч токенов, и к концу вы можете получить миллионы токенов, потраченных в совокупности на все этапы вместе взятые.
Таким образом, затраты могут очень быстро выйти из-под контроля — и это при наилучшем сценарии, когда все данные легко интерпретировать, модели не потребуются повторные попытки, и вы используете умеренно мощную модель, а не что-то вроде Claude Opus.
В финансовом выражении это означает, что один безобидный вопрос может потратить 280 000 токенов и стоить 1 доллар, по приблизительным оценкам при текущих ценах. Это может показаться не таким уж большим, но это была всего одна задача. Если вы запланируете ее выполнение каждые 15 минут для дашборда, то внезапно это будет стоить 96 долларов в день, или 2880 долларов в месяц. И этот пример задачи был довольно простым; хитроумный многоэтапный отчет может потребовать миллионов токенов, превратив этот 1 доллар, скажем, в 10 долларов, или в общей сложности в 28 800 долларов. За один отчет, для ограниченного числа пользователей, в одном отделе корпорации.
Вот ключевая причина, по которой Anthropic, Microsoft, OpenAI и почти все остальные игроки еще в апреле перевели свои основные предложения на оплату по факту использования и серьезно ограничили расход токенов в тарифах с фиксированной ставкой. Это породило множество случаев ценового шока, когда разработчики по всему миру узнали, сколько на самом деле стоит их «вайб-кодинг», и остались в оцепенении.
В крупной компании, использующей множество ИИ-агентов, такие затраты могут стать запретительными и зачастую превышать стоимость обычных сотрудников-людей. Такие фирмы, как Uber, Microsoft, Amazon и Walmart, среди многих других, отреагировали сокращением расходов на ИИ. Расход токенов внезапно стал проблемой как для финансовых, так и для инженерных отделов, поскольку контроль затрат становится первостепенным. Как лаконично выражается VentureBeat, для компаний с высокой долей агентов «редизайн промпта — это событие, влияющее на маржу», и, более образно, «плохо связанный агентный цикл — это сбой с привязанной кредитной картой».
Хотя большинство ИИ-компаний по-прежнему предлагают тарифные планы с фиксированной ежемесячной оплатой, они часто сопровождаются жесткими лимитами на токены. Однако, как это часто бывает с большинством услуг с фиксированной ценой, самые умелые «укротители ботов» неизбежно будут теми, кто сжигает больше всего токенов, не только из-за интенсивного использования как такового, но и потому, что тип выполняемых ими задач будет именно тем, который больше всего страдает от токеновой амплификации.
Это вставляет палки в колеса обычной финансовой модели, где обычные пользователи легко компенсируют затраты небольшого процента профессионалов — использование профи может серьезно подорвать ежемесячную прибыль или полностью ее «съесть».
ИИ-компании не сидят сложа руки, и снижение стоимости токена, вероятно, является сейчас первоочередной задачей для большинства их инженерных команд. Кэширование промптов, маршрутизация моделей, пакетная обработка, семантическое кэширование и управление окном контекста — вот лишь некоторые из многих технических мер, которые могут значительно сократить расход токенов, каждая из которых дает снижение на десятки процентов.
И все же затраты продолжают расти по той простой причине, что чем умнее становятся модели и чем более искусными люди в их использовании, тем более сложными и длительными будут агентные задачи, добавляя несколько порядков к количеству токенов.
На данный момент это выглядит как проигрышная гонка, несмотря на недавние достижения, такие как Deepseek V4 Pro и V4 Flash, которые значительно занижают цены сравнимым западным моделям — по сообщениям, до 17 раз для первой и до 25 раз для второй. Из крупных западных игроков только Anthropic предсказал свой первый прибыльный квартал, хотя, как и все остальные, он все еще в минусе на многие миллиарды долларов совокупных расходов.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Bruno Ferreira




