Искусственный интеллект Ataraxos одержал победу над одним из сильнейших игроков в настольную игру Stratego Пимом Неймейером. В серии из 20 партий программа выиграла 15 раз, проиграла один матч и завершила четыре встречи вничью. Над разработкой работали исследователи из Университета Карнеги — Меллона, Массачусетского технологического института, Нью-Йоркского университета и Стэнфордского университета.
Для обучения системы потребовались 16 графических процессоров и несколько тысяч долларов. Ранее компьютеры уже обыгрывали чемпионов в шахматах, го и покере, однако Stratego долго оставалась исключением. Даже DeepMind, располагающая значительными ресурсами, не смогла создать программу, которая стабильно превосходила бы лучших людей в этой игре.
Особенность Stratego связана с неполной информацией. У каждого участника есть 40 фигур с воинскими званиями от фельдмаршала до шпиона, а также бомбы и флаг. Побеждает тот, кто захватывает флаг соперника, но игрок видит расположение чужих фигур и не знает их типов до столкновения.
При встрече двух фигур более слабая удаляется, а звание победившей становится известным. «В Stratego есть нечто совершенно особенное: огромное количество скрытой информации раскрывается на протяжении очень длительного времени», — сказал соавтор исследования, сотрудник Нью-Йоркского университета Юджин Виницкий, слова которого приводит Ars Technica.
По сравнению с покером объём возможных вариантов в Stratego значительно больше. В техасском холдеме игрок скрывает только две карты, поэтому компьютер может рассмотреть 1326 возможных комбинаций. «В Stratego на доске находятся 40 фигур, которые могут располагаться в любом порядке», — отметил соавтор работы и специалист Массачусетского технологического института Габриэле Фарина.
Число возможных расстановок превышает дециллион, а партия способна продолжаться около 2000 ходов против примерно 40 ходов в шахматах. Дополнительную сложность создаёт блеф: игрок может передвигать слабую фигуру так, будто это фельдмаршал, чтобы заставить соперника отступить. Исследователи считают, что именно необходимость находить баланс между слишком частым и редким блефом ранее мешала системам, включая DeepNash, представленную DeepMind в 2022 году, успешно решать эту задачу.