Новый алгоритм Google, который драматически сжимает KV-кэш без потерь, получивший название TurboQuant, сейчас на слуху в сфере ИИ, где множатся апокалиптические прогнозы о неминуемом коллапсе спроса на память. Неважно, что базовая статья была опубликована еще в апреле 2025 года!
Тем не менее, мы предполагаем, что нынешний пессимизм на рынке пугающе схож с тем, что царил сразу после того, как DeepSeek выпустила свою модель R1 в начале 2025 года, и что парадокс Джевонса возобладает.
TurboQuant от Google усилит эффект парадокса Джевонса: высокий спрос на ресурсы памяти сохранится в обозримом будущем
Прежде чем продолжить, давайте сначала обсудим, что именно делает TurboQuant. Представьте себе сценарий: вы пишете рассказ, но вам мешает ужасная кратковременная память. Всякий раз, когда вы пишете новое слово, вы вынуждены перечитывать все, что написали до этого, чтобы вспомнить, что уже зафиксировано. Очевидно, что по мере увеличения длины текста этот трудоемкий процесс также усложняется.
Кэш «Ключ-Значение» (Key-Value или KV-кэш) похож на ведение заметок на отдельном листе, чтобы оставаться в курсе того, что уже написано. Это ускоряет весь процесс на порядки. TurboQuant от Google сжимает этот KV-кэш для заданной ИИ-модели в 6 раз, тем самым ускоряя работу самой модели до 8 раз. Более того, TurboQuant способен делать это с нулевой потерей точности.
Теперь, когда мы обсудили, что делает TurboQuant, давайте рассмотрим весь недавний пессимизм, связанный с этим прорывом. По сути, инвесторы в акции высокодоходных производителей памяти теперь опасаются, что этот алгоритм снизит предстоящий спрос на ресурсы памяти как раз в тот момент, когда крупные игроки начнут расширять мощности.
Многие люди не смогли понять того факта, что TurboQuant на самом деле не сжимает веса модели, которые часто затмевают KV-кэш в крупных развертываниях. Это означает, что размер модели остается прежним. Алгоритм кардинально улучшает экономику инференса для дата-центров, позволяя увеличить контекстное окно (количество токенов) данной модели или давая возможность меньшему числу GPU обслуживать то же количество пользователей.
Далеко не уменьшая спрос на ресурсы памяти, это нововведение на самом деле вызывает парадокс Джевонса, который постулирует, что использование технологии возрастает по мере снижения ее эксплуатационных расходов. Следовательно, было бы легкомысленно полагать, что текущий дефицит памяти закончится в ближайшее время.
Наконец, взаимодействие с парадоксом Джевонса также означает, что нам не следует ожидать скорого смягчения продолжающихся потрясений в сфере потребительской электроники, особенно роста цен, вызванного «чипфляцией» памяти для смартфонов.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Rohail Saleem




