Новости: бенчмарки
Tencent Hunyuan Hy3 уже здесь: прагматичный «AI» с 90% уровнем решения агентских задач
Tencent выпустила Hunyuan Hy3 — модель MoE на 295B параметров (21B активных), достигшую 90% разрешения задач агентов и превзошедшую DeepSeek V4 Pro и Qwen 3.7 Max в ключевых бенчмарках.

hunyuan hy3, LLM, moe, pandaily.com, Tencent, бенчмарки, ИИ
Обозреватель протестировал «RTX 4080M» в формате десктопной видеокарты на базе «чипа» от ноутбука
Оказалось, что модифицированная настольная видеокарта RTX 4080M показывает худшие результаты, чем официальные аналоги по схожей цене. Сейчас она стоит около 400 долларов в Китае и проигрывает RX 9070 GRE во всех протестированных играх, кроме PUBG.

Исследование Cursor: рейтинги ИИ-бенчмарков по программированию завышены из-за использования поиска готовых ответов
Баллы в бенчмарках по кодированию с ИИ на SWE-bench Pro завышают способность к рассуждению до 20 пунктов, как показал аудит Cursor 731 прогона оценки. Исследование выявило, что 63% решенных задач самой высокорейтинговой модели были поиском ответов, а не независимым рассуждением. Команды предприятий и инвесторы, использующие таблицу лидеров

Open-source модель программирования Ornith-1.0 самостоятельно создает каркас обучения для Reinforcement Learning
Агентная модель кодирования с открытым исходным кодом Ornith-1.0, выпущенная сегодня под лицензией MIT, использует самосовершенствующийся цикл обучения с подкреплением для написания собственного обучающего каркаса, сообщая 82.4 по SWE-Bench Verified и 62.2 по более сложному SWE-Bench Pro — результаты, которые независимые исследователи должны рассматривать как.

Правила WebKit от Apple замедляют браузеры на iOS почти на 30%
Инженеры Microsoft опубликовали результаты тестов, показывающие, что браузер на Chromium с собственным движком рендеринга набирает на 28,6% больше баллов, чем Safari, в собственном тесте производительности Apple Speedometer 3.1 на iOS. Кайл Пфлюг, менеджер по продуктам группы Microsoft Edge Web Platform, опубликовал в понедельник результаты сравнения исследовательского прототипа Edge, созданного на основе фреймворка BrowserEngineKit от Apple, с Safari под управлением iOS 26.5.1. — macrumors.com

Бенчмарки Valve Steam Machine: почти двукратный прирост производительности по сравнению со Steam Deck и результат на уровне Ryzen 5 5600X при 30 Вт
Новые тесты Steam Machine от Valve показывают производительность ЦП, сопоставимую с 6-ядерным AMD Ryzen 2020 года. Valve заявляла о превосходстве над 70% ПК, но результаты бенчмарков показывают, что система уступает более мощным настольным Ryzen. Цена станет ключевым фактором. — wccftech.com

Битва LLM в Китае: почему программирование и офисная продуктивность решают исход гонки
Битва больших языковых моделей в Китае: почему кодинг и офисная продуктивность определят победителя. Китайские LLM-компании достигли успехов, но аналитики предупреждают: погоня за бенчмарками опасна. Реальная битва — за продуктивность. — pandaily.com

Самое просматриваемое:
- Вот как использовать новую кнопку “Плюс”…
- Bitcoin Depot оштрафован на $18,5 млн – сталкивается…
- WatchGuard бьёт тревогу: критическая уязвимость…
- Как настроить ComfyUI для генерации изображений ИИ…
- ECARX берет управление бизнесом Flyme OS в свои руки…
- Результаты еженедельного опроса: Samsung Galaxy Z…
- США прикрыли платформу для хранения паролей, которой…
- Исследователи из MIT возродили 40-летнюю концепцию…
- Представитель сервисного центра Google сообщил…
- Тим Суини из Epic: «нечестность» и «грубое…


