Почему следующая гонка ИИ будет выиграна на уровне инференса

инференс Genai эффективность мультикремний суверенитет агентный ии computerweekly.com

Растущее внедрение агентного ИИ вскрывает ограничения инфраструктуры на одном стеке, заставляя предприятия пересматривать управление моделями, оборудованием и суверенитетом. Узнайте, как интеллектуальная маршрутизация рабочих нагрузок снижает затраты на инференс и повышает эффективность ИИ-систем промышленного масштаба.

По мере того как предприятия переходят от пилотных проектов с генеративным искусственным интеллектом (GenAI) к промышленным системам, внимание смещается с обучения больших языковых моделей (LLM) на управление растущей стоимостью и сложностью инференса. Согласно отчету Core42, следующее конкурентное преимущество в корпоративном ИИ будет заключаться не в развертывании самых больших моделей на самом мощном оборудовании, а в интеллектуальном сопоставлении каждой рабочей нагрузки с наиболее подходящей комбинацией модели, ускорителя и среды развертывания. В отчете «Эффективность побеждает в эпоху инференса» утверждается, что reliance на единую аппаратную экосистему или выбор по умолчанию самой большой доступной модели может значительно увеличить инфраструктурные затраты, снижая при этом общую производительность. Вместо этого предприятиям следует внедрять архитектуры ИИ, учитывающие рабочую нагрузку и способные динамически маршрутизировать запросы на инференс в соответствии с требованиями к задержке, пропускной способности, загрузке, управлению и стоимости. Полученные данные отражают более широкий сдвиг в приоритетах корпоративного ИИ, поскольку организации переходят от экспериментов к масштабным развертываниям, которые должны балансировать между производительностью и операционной эффективностью. Core42 полагает, что эта проблема станет еще более острой по мере распространения агентного ИИ. В отличие от традиционных приложений ИИ, где один пользовательский запрос обычно приводит к одному событию инференса, автономные ИИ-агенты могут генерировать множество вызовов моделей при рассуждении над задачами, обращении к внешним инструментам и выполнении многошаговых рабочих процессов. «Потребление перестает масштабироваться пропорционально численности персонала и начинает масштабироваться пропорционально автономии», — сказал Рагху Чакраварти, главный директор по продуктам и технологиям Core42. «Именно эта динамика порождает счета, намного превышающие те, что кто-либо моделировал на этапе пилота». Он добавил, что предприятия должны начинать планирование инфраструктуры на основе полных ИИ-рабочих процессов, а не просто оценивать количество пользователей или промптов: «Самая распространенная ошибка планирования — это расчет емкости на основе количества пользователей, а не событий инференса на задачу. Proof of concept, который выглядит тривиальным с горсткой пользователей, может очень быстро стать дорогим, как только агенты начнут выполнять многошаговые рабочие процессы в масштабе». Чакраварти также предостерегает от откладывания мер управления и контроля затрат на этап после развертывания. «Лимиты расходов, бюджеты, оповещения и логика маршрутизации часто рассматриваются как то, что можно добавить позже, но к тому времени потребление уже усугубилось». Вместо того чтобы рассматривать инфраструктуру как фиксированную среду, Core42 выступает за то, чтобы сделать выбор инфраструктуры активной частью оркестрации ИИ. Рабочие нагрузки ИИ значительно различаются. Интерактивные копилоты требуют чрезвычайно низкой задержки, в то время как рабочие нагрузки по суммаризации документов, индексации и классификации часто отдают приоритет пропускной способности и эффективному использованию ресурсов. Аналогичным образом, многие рутинные корпоративные задачи могут эффективно выполняться меньшими моделями, reserving frontier models для приложений, где более высокие способности к рассуждению оправдывают их дополнительную стоимость. «Маршрутизация на основе нескольких типов кремния позволяет превратить инфраструктуру в решение о размещении рабочей нагрузки», — сказал Чакраварти. «Эффективность в эпоху инференса достигается за счет отношения к аппаратному разнообразию как к экономическому активу, а не как к неудобству при закупках». Платформа Core42 Compass реализует этот подход, маршрутизируя рабочие нагрузки между более чем 60 открытыми и проприетарными ИИ-моделями, поддерживая при этом несколько архитектур ускорителей, включая Nvidia, AMD, Qualcomm и Cerebras. Решения о маршрутизации учитывают чувствительность к задержке, требования к пропускной способности, загрузку, политики управления и общую стоимость, прежде чем определить оптимальный путь выполнения. Платформа также балансирует развертывание между облачными, локальными, совместными и суверенными средами в соответствии с операционными требованиями.

Оптимизация промышленного масштаба

Core42 сообщает, что Compass уже работает в промышленном масштабе, обрабатывая более семи миллионов API-запросов и более 100 миллиардов токенов каждую неделю, обеспечивая доступность на уровне 99,5%. Компания сообщает об улучшении пропускной способности до 20 раз на своем самом быстром пути инференса Cerebras, хотя Чакраварти подчеркнул, что это не следует интерпретировать как универсальное снижение затрат. Вместо этого основное преимущество заключается в сокращении объема вычислительных мощностей премиум-класса, потребляемых для каждой выполненной бизнес-задачи. «Цель состоит в том, чтобы обеспечить требуемый бизнес-результат с правильной скоростью и стоимостью», — сказал он. Для организаций, развертывающих ИИ в таких секторах, как государственное управление, финансовые услуги и здравоохранение, интеллектуальная маршрутизация рабочих нагрузок может повысить отзывчивость для приложений, чувствительных к задержке, одновременно увеличивая загрузку инфраструктуры для пакетных рабочих нагрузок. Компания оценивает эффективность инфраструктуры с помощью метрики, которую она описывает как «токенов в секунду на доллар», отражающей баланс между производительностью и операционными затратами, а не только фокусирующейся на сырой способности модели.

Суверенитет становится операционным преимуществом

ИИ-суверенитет — это прежде всего нормативное требование. «Когда суверенитет добавляется после того, как ИИ-система уже спроектирована, организациям часто приходится перестраивать потоки данных, внедрять отдельные системы мониторинга или создавать дополнительные процедуры утверждения», — сказал Чакраварти. Интегрируя управление непосредственно в платформу ИИ, организации могут автоматически определять, где выполняются рабочие нагрузки, какие модели разрешены, кто может получить доступ к данным и как используется мониторинг. Для организаций, работающих в строго регулируемых секторах стран Персидского залива, Чакраварти утверждает, что интеграция суверенитета с оптимизацией рабочих нагрузок позволяет избежать рассмотрения управления и эффективности как конкурирующих приоритетов. «Та же самая наблюдаемость, которая показывает финансовым отделам, какой отдел сгенерировал затраты, может показать отделам управления, какая модель использовалась, где был обработан запрос и в соответствии с какой политикой», — сказал он. Чакраварти считает, что Ближний Восток следует другой траектории развития ИИ-инфраструктуры, чем многие глобальные рынки. «Во многих регионах организации сначала внедрили ИИ, а затем развернули требования к хранению данных и управлению», — сказал он. «В странах Персидского залива суверенный контроль с самого начала был обязательным требованием». Он заявил, что создание суверенной ИИ-инфраструктуры с самого начала позволяет организациям избежать дорогостоящих переделок, поддерживая при этом масштабное развертывание ИИ. Однако он предостерегает, что суверенная инфраструктура также должна сохранять технологический выбор. «Суверенная платформа по-прежнему должна предлагать разнообразные кремниевые решения и обширную библиотеку моделей», — сказал он. «В противном случае она просто меняет одну форму зависимости на другую». По мере того как корпоративный ИИ вступает в то, что Core42 называет эпохой инференса, компания считает, что конкурентное преимущество будет все больше зависеть от того, насколько эффективно организации выполняют ИИ-рабочие нагрузки, а не просто от того, какие модели они развертывают.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: