С большей частью информации, скрытой в игре Stratego, связанной с “железом”

ии Stratego игры Deepmind Deepnash Ataraxos arstechnica.com

ИИ Ataraxos победил лучшего игрока в Stratego, используя бюджетный подход. Ключевым стало добавление второй нейросети, угадывающей личности скрытых фигур.

Deep Blue победил Гарри Каспарова в шахматах в 1997 году, AlphaGo одолел Ли Седоля в го в 2016 году, а покерные боты уже много лет обыгрывают профессионалов. Но одна классическая игра под названием Stratego держалась. Даже DeepMind, располагая исключительным бюджетом, не смогла создать машину, которая бы стабильно обыгрывала лучших игроков-людей.

Теперь это удалось команде исследователей из Университета Карнеги — Меллона, Массачусетского технологического института, Нью-Йоркского университета и Стэнфордского университета. Их ИИ под названием Ataraxos победил Пима Нимейера, возможно, лучшего игрока в Stratego всех времен, со счетом 15:1, при четырех ничьих. На его обучение потребовалось всего 16 ГП и несколько тысяч долларов.

Скрытые армии

В Stratego каждый игрок получает 40 фигур, представляющих воинские звания — от маршала до шпиона, а также бомбы и флаг. Победа достигается захватом флага противника. Противник знает, где находятся ваши фигуры, но не что они собой представляют. Личности раскрываются только тогда, когда две фигуры сталкиваются в бою — более слабая убирается, и объявляется победитель. Это делает Stratego игрой с неполной информацией, как и покер, который компьютеры взломали много лет назад. «В Stratego есть нечто совершенно уникальное: огромный объем скрытой информации, который раскрывается в течение очень длительного времени», — сказал Юджин Виницкий, исследователь из Нью-Йоркского университета и один из авторов исследования.

В некоторых видах покера скрытая информация невелика. В Техасском Холдеме «у вас всего две скрытые карты», — сказал Габриэле Фарина, специалист по информатике из Массачусетского технологического института и еще один соавтор. Остается всего 1326 возможных комбинаций рук, что достаточно мало для машины, чтобы взвесить их все. «В Stratego на доске 40 фигур, которые могут располагаться в любом порядке», — сказал Фарина. Это более миллиарда миллиардов возможных расстановок. К тому же, игра длится долго.

«В шахматах игра обычно длится 40 ходов, но в Stratego игра может легко продлиться 2000 ходов», — сказал Фарина. Кроме того, Stratego — это игра блефа. Иногда вы двигаете слабую фигуру так, будто это маршал, просто чтобы напугать противника. Когда игроки блефуют слишком часто, их угрозы ничего не значат; когда они никогда не блефуют, они становятся предсказуемыми. Этот баланс, как объясняет команда, и поставил в тупик предыдущие ИИ, такие как DeepNash от DeepMind, представленный в 2022 году.

,

Учимся угадывать

Как и DeepNash, Ataraxos учился, играя сам с собой — всего 163 миллиона игр. В этих сессиях самообучения ходы, которые приводили к победам, усиливались и чаще использовались в будущих матчах, в то время как ходы, приводившие к поражениям, использовались реже — это была та же простая идея обучения. Разница заключалась в том, насколько Ataraxos корректировал свою стратегию после каждой игры, поскольку скрытая информация имеет тенденцию заставлять алгоритмы самообучения ходить по кругу. Команда решила эту проблему, внося большие, смелые изменения в стратегию на ранних этапах обучения и небольшие, осторожные — позже.

Еще более значимым нововведением было то, чего никогда не было у DeepNash: обдумывание каждого хода наперед. ИИ, такие как AlphaGo, совершенствуют свою общую стратегию с помощью поиска непосредственно перед действием. DeepMind не смог заставить это работать в Stratego, потому что пространство поиска было слишком велико, оставляя открытым вопрос, стоило ли вообще пытаться.

«Это одна из тех вещей, которые нам удалось сделать», — сказал Фарина. Решением стала вторая нейронная сеть, модель убеждений, обученная угадывать скрытые фигуры противника на основе их перемещений. Таким образом, вместо того чтобы перебирать все возможные расстановки, Ataraxos выбирает правдоподобные, разыгрывает возможные ходы в каждой из них и выбирает на основе результатов.

И это проявляется в его стиле игры.

Спокойный и невозмутимый

Название Ataraxos происходит от древнегреческого слова, обозначающего состояние спокойствия. «Это означает кого-то спокойного и невозмутимого», — объяснил Фарина. Он предполагает, что структура ИИ и отсутствие у него человеческих эмоций гарантируют, что он не будет реагировать импульсивно, «даже в ситуациях, когда человек сошел бы с ума». В то время как человек мог бы пойти на большой риск, чтобы вернуться из значительного отставания, Ataraxos медленно и методично возвращался бы в игру.

,

Разработанная им стратегия также позволяет избежать привлечения внимания к любым возникающим проблемам. Когда Ataraxos оценивает, что у противника нет причин подозревать слабое место, он оставляет это место в покое, даже если оно может показаться катастрофой для любого, кто видит обе стороны доски.

«Людям очень трудно принимать решения, зная секрет, игнорируя тот факт, что они знают этот секрет», — сказал Фарина. «Для машин это легко». Это, по словам команды, заставляет машины делать ходы, которые человек сделал бы только во время блефа, и гораздо лучше, чем люди, доводить их до конца. «Мы наблюдали, как бот «блефует» и возвращается с вероятностью победы около двух процентов, очень, очень непринужденно», — добавил Виницкий.

Нимейер, человек-игрок, против которого Ataraxos совершал эти чудесные камбэки, имеет четыре чемпионских титула и более 600 недель удерживал звание лучшего игрока мира.

Матч

В течение трех недель Нимейер сыграл 20 онлайн-партий против Ataraxos, получая по 100 долларов за каждую победу. Он знал, что ИИ не будет адаптироваться к нему, что дало ему время искать слабые места. Ему удалось выиграть только один раз.

Это поражение, как утверждают исследователи, не было настоящим недостатком. Хорошая игра в Stratego требует случайного расположения фигур, поэтому удача всегда играет роль. «Даже идеальная стратегия иногда проигрывает», — сказал Фарина.

Человеку-чемпиону, очевидно, повезло, но это было взаимно. «Иногда нам везло», — признался Виницкий.

На чемпионате мира по Stratego 2025 года участники, бросившие вызов Ataraxos, выступили еще хуже. ИИ выиграл 38 из 40 партий. В процессе он также изменил то, как играют люди. «Я думаю, этот бот немного изменил метаигру», — сказал Фарина.

Игроки были удивлены, например, тем, как часто он прятал свой флаг в углу за двумя бомбами — редко используемой расстановкой.

,

Но, возможно, лучшим трюком Ataraxos была его цена.

Цена вопроса

DeepNash обучался от двух до трех месяцев на 1024 специализированных чипах Google, что, по оценкам команды Ataraxos, обошлось бы в 3–4,5 миллиона долларов по ценам 2025 года. Ataraxos, напротив, потребовал 16 ГП в течение недели, плюс еще четыре ГП в течение четырех дней для обучения модели убеждений.

Фарина и ведущий автор Сэмюэл Сокота добились такой эффективности, написав симулятор, который обрабатывает миллионы ходов в секунду на графических картах. «В масштабах, в которых мы находимся в академической среде, у нас нет доступа к целым кластерам ГП», — сказал Фарина.

Алгоритм также учился гораздо быстрее — он сыграл примерно в 34 раза меньше игр, чем DeepNash, и при этом оказался намного сильнее.

Архитектура Ataraxos также успешно применялась для изучения других игр. Тот же подход позволил обыграть трех чемпионов мира в Barrage Stratego, более быстрой версии Stratego с восемью фигурами, освоить кооперативную карточную игру Hanabi и победить лучших ботов в китайской карточной игре доу дижу. Но команда нацелена на сценарии гораздо более сложные, чем настольные или карточные игры.

За пределами доски

Настольные игры имеют фиксированные правила и четких победителей, в то время как реальные проблемы, такие как переговоры, финансовые рынки или военные конфликты, обычно таковыми не являются. Но команда Ataraxos утверждает, что разрыв меньше, чем кажется, поскольку решение любой реальной проблемы начинается с построения ее упрощенной модели.

«Военные игры — это обычное дело», — сказал Виницкий. «Вы можете использовать методы, разработанные здесь, чтобы проиграть их вперед и увидеть, как сильный противник может отреагировать на ваши действия».

Фарина и его коллеги теперь заинтересованы в том, чтобы сделать свой ИИ более понятным, поскольку Ataraxos в его нынешнем состоянии не может объяснить, почему он делает те или иные ходы. «Мы работаем над машинами, которые производят сильные, но также интерпретируемые и объяснимые стратегии. Я думаю, мы еще не совсем там», — сказал Фарина.

Nature, 2026. DOI: 10.1038/s41586-026-11036-y

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: