Новости: инференс
GLM-5.3-Flash от Чжипу AI возглавил рейтинг глобальных ИИ-вызовов; Китай удерживает лидерство по объёму 18-ю неделю подряд
Zhipu AI подтверждает, что анонимный флагман GLM-5.3-Flash (Ox Alpha) взлетел на первое место по еженедельному объему вызовов ИИ-моделей в мире. Китайские модели удерживают лидерство 18 недель подряд. Узнайте, как модель обогнала конкурентов и почему инференс-трафик смещается в сторону Китая.

Компании, разрабатывающие AI с открытым весом, — самые желанные цели для поглощений в Кремниевой долине
Огромные средства вливаются в бизнес бесплатных ИИ-моделей. Узнайте, почему Nvidia, Stripe и другие гиганты скупают разработчиков открытых LLM, как это меняет рынок и стоит ли вашему бизнесу переходить на open-weight модели.

Nvidia и Cerebras продают производительность, которую их клиенты (вероятно) никогда не увидят
Хвастаться генерацией одного токена — все равно что хвастаться максимальной скоростью автомобиля. Узнайте, почему пиковые показатели Nvidia Groq-3 и Cerebras CS-4 в 3400 ток/с — это маркетинг, а не реальная производительность, и какой бенчмарк действительно важен для премиального инференса.

Чжипу подтверждает: анонимная модель «Niu Lai» — это GLM-5.3-Flash, работающая на 100 000 отечественных чипах
Zhipu AI раскрыла, что анонимная модель Ox Alpha — это GLM-5.3-Flash, работающая исключительно на кластере из более 100 000 отечественных чипов с эффективностью, сопоставимой с Nvidia. Узнайте, как модель обогнала DeepSeek по трафику и бросила вызов CUDA.

Пекинский AI-бар, предлагающий неограниченные бесплатные токены ДипСик для кодинга с напитком за $1.50, истекает деньгами
Пекинский AI-бар раздает бесплатные токены DeepSeek с напитками, запуская модели локально на двух Nvidia DGX Spark. Узнайте, как заведение теряет деньги, автоматизирует работу агентами и планирует внедрить роботов, а также почему выставочные мини-ПК стоят дороже, чем весь бизнес.

Оценка Etched удваивается до $21B за месяц
Узнайте, почему оценка ИИ-стартапа Etched выросла с $10,3 млрд до $21 млрд за месяц: Jane Street протестировала чип, установила кластер в свой дата-центр и возглавила новый раунд. Читайте о технологиях prefill и decode, которые ускоряют инференс и снижают затраты.

5-нм RISC-V чип Alibaba от TSMC, Сюаньте C950, теперь нативно запускает модель Qwen-3.8 27B, открывая масштабные попутные ветры вертикальной интеграции.
Alibaba запускает поддержку модели Qwen-3.8 27B на собственном чипе XuanTie C950 с первого дня. Узнайте, как RISC-V процессор с 64 ядрами и встроенными ускорителями обеспечивает 30 токенов/с и TTFT 1,9 с, создавая конкурентное преимущество на рынке ИИ.

Groq привлекает $350 млн на разворот: с AI-чипов на neocloud
Groq привлек $350 млн при оценке $3,5 млрд — бывший производитель AI-чипов переходит в неооблачный бизнес, расширяя инфраструктуру Nvidia до 13 дата-центров. Узнайте, как компания планирует масштабировать инференс и конкурировать с CoreWeave.

Ког углубляется, чтобы выжать больше «inference» из GPU
Французский стартап Kog обещает 30-кратное ускорение LLM-инференса на стандартных датацентровых GPU за счет оптимизации ПО. Компания уже получила 200 коммерческих лидов и планирует в сентябре продемонстрировать 10-кратное ускорение на крупной модели, чтобы привлечь клиентов и закрыть раунд A.

Самое просматриваемое:
- Вот как использовать новую кнопку “Плюс”…
- Bitcoin Depot оштрафован на $18,5 млн – сталкивается…
- WatchGuard бьёт тревогу: критическая уязвимость…
- Оверклокер обновил утилиту для разгона Hydra —…
- Как настроить ComfyUI для генерации изображений ИИ…
- Результаты еженедельного опроса: Samsung Galaxy Z…
- ECARX берет управление бизнесом Flyme OS в свои руки…
- Исследователи из MIT возродили 40-летнюю концепцию…
- США прикрыли платформу для хранения паролей, которой…
- Обои HONOR Magic V6 для любого смартфона: 15…
