Учёные разработали систему искусственного интеллекта Ataraxos, которая с большим преимуществом обыграла сильнейших игроков в настольную военно-стратегическую игру Stratego. Исследователи считают, что такой подход в будущем может помочь людям выбирать стратегии в ситуациях с неполной информацией, включая военные манёвры, деловые переговоры и кибербезопасность. О работе сообщает Массачусетский технологический институт.
В проекте участвовали специалисты Массачусетского технологического института, Университета Карнеги — Меллон, Нью-Йоркского университета и Стэнфордского университета. Результаты исследования опубликованы в журнале Nature. По словам старшего автора работы Габриэле Фарины, создание универсальных алгоритмов, способных надёжно действовать в условиях огромного числа неизвестных вариантов, стало важным шагом вперёд.
Stratego используют для проверки стратегических возможностей ИИ, поскольку игроки не видят типы фигур соперника. Каждый участник размещает на своей половине доски 40 фигур и пытается захватить флаг противника, однако их принадлежность к разным рангам раскрывается только при столкновении. Число возможных конфигураций превышает 10 в 66-й степени, что делает игру значительно сложнее шахмат.
Ataraxos обучали методом обучения с подкреплением через самостоятельную игру. Система сначала сформировала базовую стратегию, а затем перед каждым ходом уточняла решение с помощью планирования в момент принятия решения. Генеративная модель оценивала вероятные типы скрытых фигур соперника и просчитывала дальнейшие варианты, не требуя перебора всех возможных ходов.
По данным исследователей, Ataraxos превзошла систему DeepNash от DeepMind, используя менее одной сотой обучающих примеров и менее одной тридцатой числа партий, сыгранных в процессе самостоятельного обучения. В матче с сильнейшим игроком в Stratego программа победила со счётом 15:1 при четырёх ничьих, а на чемпионате мира выиграла 39 партий и проиграла две. Фарина отметил, что система умеет спокойнее оценивать риск и не раскрывает свои намерения из-за единичной угрозы.
Учёные проверили метод и в других играх с неполной информацией: ускоренной версии Stratego Barrage Stratego, кооперативной карточной игре Hanabi и Dou dizhu, где двое участников играют против третьего. Во всех случаях Ataraxos показала сверхчеловеческий результат. В дальнейшем авторы хотят добавить в систему средства интерпретируемости, чтобы она могла объяснять свои решения человеку; исследование частично профинансировали Управление военно-морских исследований, Национальный научный фонд США и другие организации.