Разработчик под ником «stmonty» обучил небольшую модель ИИ на одной видеокарте RTX 3080 Ti для игры в Pokémon Red. В своем посте в блоге «Обучение мировой модели игре в Pokémon» разработчик подробно описал процесс обучения модели, которая начинает с сохранения и выбирает стартового покемона. Модель представляет собой так называемую мировую модель, основанную на исследовании LeWorldModel, одним из авторов которого является известный ученый в области ИИ Ян Лекун. Лекун покинул *Meta в прошлом году, чтобы создавать мировые модели со своей компанией AMI Labs, используя тот же подход. Эта конкретная модель была обучена всего примерно на 12,5 миллионах параметров и описана 20 сентября. На форуме stmonty назвал проект способом «учиться и получать удовольствие», а модель выбрал потому, что ее можно было обучать локально на потребительской видеокарте.
Модели пришлось изучить, что делает каждое нажатие кнопки, анализируя выводимое на экран изображение. Вместо того чтобы предсказывать следующий экран целиком, она использует сжатые представления всего из 192 чисел. Первоначальное обучение «не вознаграждается» в том смысле, что модель не знает об условиях победы. Цели появляются позже, когда модель планирует действия. Эта конструкция следует мартовской статье 2026 года, описывающей единую модель JEPA примерно с 15 миллионами параметров, которую можно обучать на одном GPU, что не сильно отличается от модели stmonty.
Полный цикл обучения потребовал 42 382 кадра в градациях серого за более чем 1000 коротких запусков, используя сохранение в лаборатории профессора Оука. Данные включали скриптовые маршруты, те же маршруты со случайными нажатиями кнопок и случайное блуждание. Последняя часть необходима, потому что модель, обученная только на чистых прохождениях, «может увидеть нажатие A каждый раз, когда появляется диалоговое окно, и никогда не узнать, что делает B в этом случае», — сказал stmonty. Модель была обучена с нуля для этого проекта.
Планы разрабатываются с использованием 14 нажатий кнопок и тестируются в модели, а не в игре. Каждый раунд содержит 512 образцов плана, из которых поиск выбирает один из восьми, то есть 64. Это продолжается до тех пор, пока окончательный план не будет выполнен в эмуляторе игры. Stmonty предполагает, что одной из возможных причин сбоя, из-за которого игрок остался без покемона, является накопление мелких ошибок при прогнозировании на основе собственных прогнозов модели.
Следующая попытка, после некоторой доработки, увенчалась успехом: модель выбрала Squirtle. Затем за более чем 100 запусков с того же сохранения было получено 52 плана, которые позволили выбрать стартового покемона, по сравнению с нулем для случайных нажатий кнопок и всего одним для необученной модели. Stmonty заявил, что многократное нажатие A уже работает с сохранения, и целью было, чтобы модель сама нашла решение. Это все еще скромный результат, но он демонстрирует, что небольшие модели могут быть адаптированы для конкретных задач.
Следующая цель, которую разработчик «возможно, еще попытается» достичь, — это начать в лаборатории, дойти до профессора, пройти диалог, а затем фактически выбрать покемона. «Я подозреваю, что сложность растет экспоненциально с длиной плана», — сказал разработчик. Увеличение размера модели, вероятно, не приведет к победе в игре: «Я не думаю, что простое увеличение моей текущей модели приведет нас к цели», — заявил разработчик в ответе.
Подход с использованием небольшой модели для игры в Pokémon Red — один из многих за последние недели, с как минимум двумя отдельными и успешными попытками пройти игру с использованием модели Jev decision и пользовательского кода. Однако они используют более сложные подходы, в то время как небольшие модели остаются реалистичным вариантом для энтузиастов. Код проекта является открытым исходным кодом и доступен на GitHub под названием lePokeRed, рекомендуется использование GPU с CUDA.
*Facebook, *Instagram и *WhatsApp принадлежат компании *Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Shane Downing




