[논문 리뷰] Mastering the Game of Stratego with Model-Free Multiagent Reinforcement Learning
이 논문은 자기연습과 Regularised Nash Dynamics (R-NaD) 알고리즘을 사용하여 전적으로 스스로 Stratego를 습득하는 모델-프리 다중에이전트 강화학습 에이전트인 DeepNash를 소개한다. 이 에이전트는 인간 전문가 수준의 성능을 달성하여 Gravon 플랫폼에서 상위 3위를 기록했으며, $10^{535}$개의 노드를 가진 복잡한 불완전 정보 게임에서 기존의 AI 방법을 초월한다.
We introduce DeepNash, an autonomous agent capable of learning to play the imperfect information game Stratego from scratch, up to a human expert level. Stratego is one of the few iconic board games that Artificial Intelligence (AI) has not yet mastered. This popular game has an enormous game tree on the order of $10^{535}$ nodes, i.e., $10^{175}$ times larger than that of Go. It has the additional complexity of requiring decision-making under imperfect information, similar to Texas hold'em poker, which has a significantly smaller game tree (on the order of $10^{164}$ nodes). Decisions in Stratego are made over a large number of discrete actions with no obvious link between action and outcome. Episodes are long, with often hundreds of moves before a player wins, and situations in Stratego can not easily be broken down into manageably-sized sub-problems as in poker. For these reasons, Stratego has been a grand challenge for the field of AI for decades, and existing AI methods barely reach an amateur level of play. DeepNash uses a game-theoretic, model-free deep reinforcement learning method, without search, that learns to master Stratego via self-play. The Regularised Nash Dynamics (R-NaD) algorithm, a key component of DeepNash, converges to an approximate Nash equilibrium, instead of 'cycling' around it, by directly modifying the underlying multi-agent learning dynamics. DeepNash beats existing state-of-the-art AI methods in Stratego and achieved a yearly (2022) and all-time top-3 rank on the Gravon games platform, competing with human expert players.
연구 동기 및 목표
- 기하학적 게임트리가 $10^{535}$개 노드에 이르고 극도로 불완전한 정보를 가진 전설적인 보드게임인 Stratego를 정복하는 데 장기적인 과제를 해결하기 위해.
- 기존의 계획 수립 및 탐색 방법이 실패하는 환경에서 인간의 지도 없이도 최적의 전략을 스스로 학습할 수 있는 AI 에이전트를 개발하기 위해.
- 다중에이전트 강화학습에서의 학습 동역학의 불안정성을 극복하기 위해, 사이클에 빠지지 않고 나시 균형에 수렴하는 방법을 설계하기 위해.
- 장기적인 에피소드, 높은 행동 공간, 명백한 하위 문제 분해가 어려운 환경에서 불확실성 하에 전략적 의사결정을 엔드 투 엔드로 학습할 수 있도록 하기 위해.
제안 방법
- DeepNash는 Regularised Nash Dynamics (R-NaD) 알고리즘에 기반한 모델-프리 딥 강화학습 접근법을 사용하며, 학습 동역학을 수정하여 근사 나시 균형에 수렴하도록 한다.
- 에이전트는 자기연습을 통해 학습하며, 환경 모델이나 탐색에 의존하지 않고 게임 상태에서 행동으로 매핑하는 딥 네ural 네트워크 정책을 훈련한다.
- 추론 중에 공개 정보를 사용하여 가치의 상한을 추정함으로써 위험한 행동을 잘라내는 가치 범위 히ュ리스틱을 적용하여 안정성을 향상시킨다. 이는 승률 향상에는 크게 기여하지 않지만, 성능을 떨어뜨리는 실수를 방지하는 데 유용하다.
- 기존의 상대방 행동을 저장하고 재사용하는 메모리 히ュ리스틱을 통해 장기적이고 복잡한 게임에서 정책의 일반화 능력을 향상시키고 과적합을 줄인다.
- 훈련을 안정화하고 다중에이전트 환경에서 탐색을 장려하기 위해 엔트로피 정규화를 포함한 보상 변환을 사용한다.
- 추론 시, 행동 임계값 설정과 이산화와 같은 테스트 시점 개선 기법을 적용하여 핵심 정책을 변경하지 않고도 의사결정 품질을 향상시킨다.
실험 결과
연구 질문
- RQ1모델-프리 다중에이전트 강화학습 에이전트가 $10^{535}$개 노드를 가진 게임트리와 극도로 불완전한 정보를 가진 Stratego에서 전문가 수준의 성능을 달성할 수 있는가?
- RQ2R-NaD 알고리즘이 다중에이전트 환경에서 학습 동역학을 안정화시키고 나시 균형 주변의 사이클을 방지하여 안정된 정책으로 수렴하게 할 수 있는가?
- RQ3인간의 지도 없이 엔드 투 엔드 자기연습 훈련이 기존 AI 방법이 아마추어 수준에 머물러 있던 게임에서 초인간 수준의 성능을 달성할 수 있는가?
- RQ4테스트 시점 히ュ리스틱인 가치 범위와 메모리가 학습된 정책을 변경하지 않고도 실제 운영 환경에서 성능을 얼마나 향상시키는가?
- RQ5이러한 에이전트가 Probe, Master of the Flag, Demon of Ignorance와 같은 기존의 확립된 AI 시스템을 경쟁 평가에서 능가할 수 있는가?
주요 결과
- DeepNash는 Gravon 온라인 Stratego 플랫폼에서 2022년 연간 및 종합 상위 3위를 기록했으며, 인간 전문가 플레이어들과 경쟁했다.
- Direct evaluation에서 Probe (버전 2.0.37), Master of the Flag (v5.2.0.40), Demon of Ignorance (v0.13.4)를 포함한 기존 최고 수준의 AI 방법들을 초월했다.
- 가치 범위 히ュ리스틱과 메모리 히ュ리스틱는 실수를 방지하는 데 실제로 도움이 되었지만, DeepNash의 자기연습 버전과의 평가에서 승률 향상은 유의미하지 않아, 이는 안정화 기능이지 성능 향상 기능이 아니라는 것을 시사한다.
- Gravon에서의 대국에서 가치 범위 히ュ리스틱은 DeepNash의 1.5% 미만의 수순에 영향을 주었으며, 이는 드문 근거가 되는 보호 장치이지만 매우 유용하다는 것을 의미한다.
- 인간 전문가, 특히 전 세계 챔피언이었던 Vincent de Boer는 에이전트의 강함에 놀라며 공식 세계 챔피언십에서 좋은 성과를 낼 것으로 기대했다.
- 에이전트는 모델-프리, 자기연습 기반 강화학습가 극도로 불완전한 정보와 스케일이 큰 게임에서 성공할 수 있음을 입증했으며, 이는 이전의 탐색 기반 또는 모델 기반 접근 방식의 한계를 극복했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.