Чжипу подтверждает: анонимная модель «Niu Lai» — это GLM-5.3-Flash, работающая на 100 000 отечественных чипах

Zhipu Ai Glm-5.3-Flash отечественные чипы инференс Deepseek Cuda pandaily.com

Zhipu AI раскрыла, что анонимная модель Ox Alpha — это GLM-5.3-Flash, работающая исключительно на кластере из более 100 000 отечественных чипов с эффективностью, сопоставимой с Nvidia. Узнайте, как модель обогнала DeepSeek по трафику и бросила вызов CUDA.

26 августа Zhipu AI подтвердила, что анонимная модель Ox Alpha, известная в кругах китайских разработчиков как «Ню Лай», является её недавно выпущенной GLM-5.3-Flash. До официального дебюта модель предлагалась бесплатно в анонимном тестировании на OpenRouter и OpenCode, привлекая более 50 триллионов токенов трафика за пять дней и устанавливая рекорды роста на обеих платформах. С тех пор её использование более чем вдвое превысило показатели DeepSeek.
Что привлекло внимание рынка, так это деталь, которую Zhipu раскрыла позже: весь этот трафик обслуживался отечественными чипами. В своей технической документации Zhipu заявила, что её инференс-сервис работал на кластере из более чем 100 000 отечественных чипов, и что «эффективность оборудования и стоимость за токен достигли уровня, сопоставимого с主流ными GPU Nvidia».
Полупроводниковая исследовательская фирма SemiAnalysis прокомментировала в X, что с каждым запросом, обрабатываемым отечественным кремнием с эффективностью, сопоставимой с Nvidia, «защитный ров CUDA снова подвергается испытанию» после объявления OpenAI о собственном инференс-чипе Jalapeño. LatePost сообщила, что чипы могут быть от Huawei, Moore Threads и Hygon, хотя Zhipu не подтвердила поставщиков или модели.
Чтобы масштабироваться до контекста в 1 миллион токенов, Zhipu построила специализированный инференс-движок на SGLang, используя W8A8-квантование, смешанное INT8/FP8/BF16-квантование кэша и тензорный параллелизм на уровне узлов, а также производственную архитектуру с разделением Encode-Prefill-Decode, которая разделяет мультимодальное кодирование, префилл промпта и поканальное декодирование в независимо планируемые пулы. Компания утверждает, что сквозная производительность сервиса улучшилась в 3 раза по сравнению с исходным базовым уровнем на том же оборудовании.
GLM-5.3-Flash имеет 320 миллиардов общих параметров с 18 миллиардами активированных, что примерно соответствует DeepSeek V4 Flash. Она набирает 57 баллов по Индексу искусственного анализа, наравне с Claude Opus 4.8 и выше DeepSeek V4 Pro. Ценообразование составляет примерно одну десятую от GLM-5.3 и одну сороковую от Claude Opus 4.8, что позиционирует её как недорогой вариант на фоне более широкого раунда повышения цен на китайские модели.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: