XPower Technology стала темной лошадкой на отечественной арене AI-вычислений на WAIC 2026, представив свою полностековую матрицу продуктов AI-ускорителей на основе собственной архитектуры реконфигурируемых параллельных процессоров RPP, охватывающую сценарии облачных, граничных и конечных устройств. Ключевое предложение напрямую бросает вызов индустриальной ортодоксии больших чипов: чипы AE7100E размером с ноготь, 12 из которых могут быть интегрированы на одну карту ускорителя, поддерживающую развертывание больших языковых моделей с параметрами от 400 миллиардов до 1,6 триллиона с помощью распределенных вычислений, достигая оптимальной в отрасли эффективности стоимости токена.
Стратегический выбор времени обусловлен переходом от AI-вычислений, ориентированных на обучение, к вычислениям, ориентированным на инференс. Генеральный директор XPower Ли Юань назвал AI-программирование ключевым сценарием использования для инференса, отметив, что собственный опыт компании показывает: AI теперь может выполнять работу по разработке компилятора CPU, которая раньше требовала от профессиональной команды лет, за считанные часы, и эта способность может быть превращена в навык для быстрого воспроизведения в различных задачах. Поскольку 55% вызовов моделей в мировых центрах обработки данных приходится на рынок моделей с открытым исходным кодом, доступный рынок инференса больше не ограничен несколькими гигантами, а открыт для каждого предприятия, создавая огромный новый спрос на экономически эффективную инфраструктуру инференса.
Ключевое понимание — неэффективность больших чипов в инференсе: декодирование требует соотношения вычислений к данным 1:1, но GPU обеспечивают 1000:1, растрачивая мощность. XPower RPP использует распределенные маленькие чипы, достигая мелкозернистой специализации в рамках одного сервера.
Подход XPower заменяет дорогую HBM на зрелую технологию LPDDR, утверждая, что AI-инференсу в основе нужны три вещи: большой объем, достаточная пропускная способность и низкая стоимость. LPDDR обеспечивает все три при доле стоимости HBM. Конфигурация с 12 чипами на карту позволяет мелкозернистое разделение памяти и параллельную обработку между чипами в рамках одного серверного форм-фактора. Эта распределенная серверная архитектура отличает XPower от подхода NVIDIA Groq, который также использует распределенные многокристальные конструкции, но в масштабе больших кластеров. Врожденная гибкость архитектуры RPP, балансирующая между универсальными и специализированными вычислениями, позволяет одному чипу охватывать сценарии развертывания в облаке, на границе и на конечных устройствах.
На WAIC XPower продемонстрировала свою матрицу продуктов от чипа AE7100E до карт ускорителей и 8-карточных высокоплотных серверных шкафов. Переход компании от граничных вычислений к облачным представляет собой стратегическую ставку на то, что рынок инференс-вычислений, который, по оценкам XPower, в 10 раз превышает рынок обучения по общей адресуемой стоимости, будет выигран не за счет наибольшей однокристальной вычислительной мощности, а за счет наиболее экономически эффективных распределенных систем. Рыночное подтверждение этой гипотезы будет зависеть от результатов реального развертывания, но архитектура RPP представляет собой один из самых самобытных отечественных подходов к вычислениям, делая ставку против консенсуса больших чипов и утверждая, что будущее AI-инференса принадлежит не отдельным монолитным процессорам, а роям скоординированных маленьких чипов.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




