Нейросеть Ataraxos обыграла Пима Нимейера в Stratego 15:1

Нейросеть Ataraxos обыграла Пима Нимейера в Stratego 15:1

Deep Blue победил Гарри Каспарова в шахматы в 1997 году, AlphaGo обыграла Ли Седоля в го в 2016-м, а покерные боты уже много лет выигрывают у профессионалов. Но классическая настольная игра Stratego долго не поддавалась: даже DeepMind с её исключительным бюджетом не смогла построить машину, которая стабильно обыгрывала бы сильнейших людей.

Теперь это сделала команда исследователей из Carnegie Mellon, MIT, Нью-Йоркского университета (NYU) и Стэнфорда. Их ИИ под названием Ataraxos выиграл у Пима Нимейера, которого Ars Technica называет, возможно, лучшим игроком в Stratego за всю историю, со счётом 15:1 при четырёх ничьих. По словам издания, для обучения потребовалось всего 16 GPU и несколько тысяч долларов.

Правила: у каждого игрока по 40 фигур, обозначающих воинские звания, от маршала до шпиона, плюс бомбы и флаг. Побеждает тот, кто захватит флаг соперника. Противник видит, где стоят ваши фигуры, но не знает, какие это фигуры. Личность фигуры раскрывается только при столкновении в бою: более слабая снимается с доски, а личность победителя становится известной. Поэтому Stratego относится к играм с неполной информацией, как и покер, который компьютеры «взломали» несколько лет назад. Исследователь NYU и соавтор работы Юджин Винитски (Eugene Vinitsky) говорит, что у Stratego есть особенность: огромный объём скрытой информации, раскрывающийся на очень длинном временном отрезке.

Чем Stratego сложнее покера. В техасском холдеме скрытых карт всего две, и это даёт лишь 1326 возможных рук, так что машина может перебрать их все, объясняет Габриэле Фарина (Gabriele Farina), специалист по информатике из MIT и ещё один соавтор. В Stratego 40 фигур могут стоять в любом порядке, и вариантов расстановки больше децилиона. Есть и длина партии: по словам Фарины, в шахматах игра обычно длится около 40 ходов, а в Stratego может легко дойти до 2000.

К этому добавляется блеф: иногда слабую фигуру двигают так, будто это маршал, чтобы отпугнуть соперника. Если блефовать слишком часто, угрозы теряют вес, а если не блефовать вовсе, игрок становится предсказуемым. Именно этот баланс, как объясняет команда, и оказался не под силу прежним ИИ, например DeepNash от DeepMind, представленному в 2022 году. Доступная часть материала обрывается на этом месте; как именно устроен Ataraxos, в ней не описано.

Ключевые факты

  • Ataraxos обыграл Пима Нимейера, которого Ars Technica называет, возможно, сильнейшим игроком в Stratego за всю историю: 15 побед, 1 поражение и 4 ничьи.
  • Над ИИ работали исследователи из Carnegie Mellon, MIT, NYU и Стэнфорда; в материале названы соавторы Юджин Винитски (NYU) и Габриэле Фарина (MIT).
  • Обучение, по данным издания, заняло 16 GPU и несколько тысяч долларов.
  • Сложность Stratego: 40 скрытых фигур с расстановками больше децилиона (в холдеме всего 1326 возможных рук), партии до 2000 ходов (в шахматах около 40) и необходимость балансировать блеф.
  • Прежние ИИ, включая DeepNash от DeepMind (2022), по объяснению команды, не справились именно с балансом блефа.

Почему это важно

Stratego считалась одной из игр, которые ИИ долго не удавались, хотя шахматы, го и покер были покорены раньше. Авторы статьи подчёркивают: даже DeepMind с исключительным бюджетом не смогла создать машину, которая стабильно обыгрывала бы сильнейших людей. Ataraxos выиграл у Нимейера 15 партий из 20 при одном поражении. Для области игр с неполной информацией это заметный шаг, а заявленная цена обучения (16 GPU и несколько тысяч долларов) говорит о том, что результат получен без огромных ресурсов.

Кому это важно

Прежде всего исследователям ИИ, которые занимаются играми с неполной информацией, и тем, кто следит за историей соревнований машины и человека. Для широкого круга разработчиков прямых выводов из доступного фрагмента статьи нет.

Как это применить

Прямого практического применения в доступном фрагменте не описано: там нет ни кода, ни сведений о доступности системы. Полезный ориентир другого рода: по словам издания, сильный результат в сложной игре получен на 16 GPU и за несколько тысяч долларов, то есть без бюджета уровня DeepMind.

Можно ли доверять

Пересказ основан на материале Ars Technica, причём доступна только его первая часть: она обрывается на абзаце про DeepNash. Результат матча и цифры по обучению приведены со слов издания, цитируются соавторы Винитски и Фарина. Нимейер назван лучшим игроком «возможно» (arguably), это оценка издания. Как работает Ataraxos, каковы формат и дата матча, прошла ли работа рецензирование и каково название статьи, в доступном тексте не указано.

Риски и подводные камни

Из текста следует только результат против одного игрока, Нимейера. О превосходстве над всеми людьми или всеми другими ИИ в источнике не говорится. Стоимость обучения указана приблизительно («несколько тысяч долларов»), тип GPU и длительность не названы. Сам метод не раскрыт, поэтому судить о том, чем Ataraxos решил проблему блефа, по этому фрагменту нельзя.

«В Stratego есть нечто совершенно особенное: огромный объём скрытой информации, который раскрывается на очень длинном временном отрезке.»

— Юджин Винитски, исследователь NYU и соавтор исследования