Новости: swe-bench pro
Исследование Cursor: рейтинги ИИ-бенчмарков по программированию завышены из-за использования поиска готовых ответов
Баллы в бенчмарках по кодированию с ИИ на SWE-bench Pro завышают способность к рассуждению до 20 пунктов, как показал аудит Cursor 731 прогона оценки. Исследование выявило, что 63% решенных задач самой высокорейтинговой модели были поиском ответов, а не независимым рассуждением. Команды предприятий и инвесторы, использующие таблицу лидеров

Самое просматриваемое:
- Вот как использовать новую кнопку “Плюс”…
- WatchGuard бьёт тревогу: критическая уязвимость…
- Bitcoin Depot оштрафован на $18,5 млн – сталкивается…
- Оверклокер обновил утилиту для разгона Hydra —…
- Как настроить ComfyUI для генерации изображений ИИ…
- США прикрыли платформу для хранения паролей, которой…
- Результаты еженедельного опроса: Samsung Galaxy Z…
- Intel преодолела рубеж в миллион пластин,…
- ECARX берет управление бизнесом Flyme OS в свои руки…
- Глава Sonic Team Иидзука: Sega хотела отменить всю…