Разработчик заявил: ИИ-модель Jev прошла Pokémon Red меньше чем за неделю

ии Pokémon Typesafe Ai Claude Opus ии-агент модель принятия решений tomshardware.com

«Джев» от TypeSafe AI победил в Pokémon Red менее чем за неделю, войдя в Зал славы. Узнайте, как модель принятия решений с помощью Claude Opus 5 и зрителей прошла игру.

«Джев» от TypeSafe AI 23 сентября 2026 года «победил Элитную четверку и Чемпиона и вошел в Зал славы» в игре Pokémon Red, согласно странице проекта разработчика. В отличие от чат-ботов, которым требовались недели или месяцы, чтобы пройти версию игры Blue, «Джев» может только выбирать из списка вариантов. Однако он добился этого не без помощи. Claude Opus 5 от Anthropic отслеживал игровой журнал и корректировал варианты и их формулировки по мере игры «Джева», фактически выступая в роли тренера. Разработчик, Эндрю Бойд, является основателем Standard Agents Inc., которая продает платформу для создания ИИ-агентов. Бойд изначально анонсировал проект в X, заявив о победе через неделю. Игровой процесс транслировался в прямом эфире, был доступен в браузере или терминале, с чатом, который модерировал «Джев».
«Джев» — это недавно выпущенная модель принятия решений, которая выдает решения с указанием степени уверенности. Это не чат-бот и не LLM. Для игры «Джев» обращается к списку вариантов с фактами и выбирает лучший вариант на основе вероятности. Он не читает экран и не генерирует текст или изображения. Традиционная LLM, Claude Opus 5, отслеживала игровой журнал, чтобы помочь «Джеву», когда тот застревал. Это происходило косвенно путем изменения вариантов и данных, доступных «Джеву».
В журнале изменений системы управления было 474 записи, большинство из которых представляли собой сбой из игрового журнала, сопряженный с внесенным изменением. Примеры ошибок включают 53-кратное «вхождение в закрытый вход Лорелеи», 124-кратное пересечение одной лестницы в Скальном тунне «за десять минут» и поражение от Алакадзама Чемпиона после победы над всеми четырьмя тренерами Элитной четверки, что заставило «Джева» снова победить всех четверых, прежде чем он смог одолеть Чемпиона позже в тот же день.
Opus внес коррективы как по точности, так и по стоимости. Используя заметки о модели от TypeSafe, он сократил объем текста, отправляемого «Джеву», примерно на две трети, и использовал слова вместо чисел. Когда «Джев» застревал в цикле, система управления была изменена, чтобы запрашивать решение только каждые шесть секунд вместо примерно одного раза в секунду. Также присутствовал человеческий ввод: зрители отправляли подсказки в чат, и полезные из них использовались для улучшения списка вариантов «Джева». Зависимость от Opus, разработчика и аудитории демонстрирует сильные и слабые стороны модели принятия решений.
Второй прогон с использованием «Джева», выполненный Кристианом Матисеном из Frigade, описал другой подход. Система управления в данном случае, согласно ее README, «читает память игры, перечисляет допустимые варианты… и «Джев» выбирает один», но никогда не записывает в память игры. Матисен сказал, что его первая версия, где «Джев» мог напрямую выбирать кнопки, «так и не покинула Палетта Таун». По его собственной оценке, стоимость составляет «около 1–1,70 доллара за 24 часа».
Отдельный эксперимент с Pokémon Red пошел другим путем. Разработчик под псевдонимом stmonty обучил небольшую мировую модель на RTX 3080 Ti с использованием более 42 000 кадров игрового процесса. Начиная с сохранения в лаборатории профессора Оука, модель выбирала стартового покемона в 52 из 100 попыток, согласно сообщению в блоге stmonty. Как цель, так и помощь были гораздо меньше, чем у «Джева»: модель stmonty должна была научиться тому, что делает каждый ввод, только по скриншотам.
Вирусный характер «Джева», который LangChain описывает как «вызвавший довольно большой резонанс» с момента запуска 15 сентября, привел к тому, что несколько разработчиков начали играть в игру в течение 10 дней. Успех этого прогона демонстрирует, что сотрудничество со специализированными моделями может существенно улучшить решение проблем. Сама TypeSafe заявляет, что открытые задачи лучше подходят для LLM, как мы сообщали при запуске «Джева». Для сравнения, стрим Anthropic Claude Plays Pokémon, работающий на тот момент на Opus 4.5, по состоянию на январь еще не закончил Red. На этот раз, когда «Джев» играл, а Claude писал правила, разработчик добился победы.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: