[논문 리뷰] Mastering Strategy Card Game (Legends of Code and Magic) via End-to-End Policy and Optimistic Smooth Fictitious Play
이 논문은 두 단계 전략 카드 게임 레전드 오브 코딩 앤 매지션을 마스터하기 위해 엔드 투 엔드 딥 강화학습 정책과 옵timistic 스무스 허위 플레이(осф) 알고리즘을 제안한다. OSFP 내부에서 딥 RL을 부드러운 최적 반응 솔버로 통합함으로써, 이 방법은 내쉬 균형 수렴을 달성했고 COG2022 대회에서 두 트랙 모두 1위를 차지하여 다단계 게임 환경에서 뛰어난 성능을 입증하였다.
Deep Reinforcement Learning combined with Fictitious Play shows impressive results on many benchmark games, most of which are, however, single-stage. In contrast, real-world decision making problems may consist of multiple stages, where the observation spaces and the action spaces can be completely different across stages. We study a two-stage strategy card game Legends of Code and Magic and propose an end-to-end policy to address the difficulties that arise in multi-stage game. We also propose an optimistic smooth fictitious play algorithm to find the Nash Equilibrium for the two-player game. Our approach wins double championships of COG2022 competition. Extensive studies verify and show the advancement of our approach.
연구 동기 및 목표
- 레전드 오브 코딩 앤 매지션과 같이 단계 간 관측 및 행동 공간이 상이한 다단계 전략 게임에 대한 도전에 대응하기 위해.
- 데크 구축 및 전투 단계를 하나의 훈련 가능한 정책으로 통합하는 엔드 투 엔드 정책을 개발하기 위해.
- 대규모 양자간 제로섬 게임에서 내쉬 균형으로의 빠른 수렴을 보장하는 옵티미스틱 스무스 허위 플레이 알고리즘을 설계하기 위해.
- 광범위한 실험과 대회 기준을 통해 방법의 우수성을 검증하기 위해.
제안 방법
- 두 명의 플레이어 간 제로섬 게임에서 마지막 반복 수렴 보장을 갖는 딥 강화학습을 부드러운 최적 반응 솔버로 사용하는 옵티미스틱 스무스 허위 플레이(осф) 알고리즘을 제안한다.
- 게임 트리 공간에서 정책을 트리플렉스로 표현함으로써, 확률 질량 제약 조건을 충족시키면서 다단계 결정 단계에 걸쳐 정책 표현을 가능하게 한다.
- 내쉬 균형을 최적 반응 연산자의 고정점으로 표현하기 위해 변분 부등식(VI) 수식을 사용함으로써 효율적인 최적화를 가능하게 한다.
- 이중선형 수익 함수 $ u(x,y) = x^T A y $ 를 사용하며, 여기서 $ A $ 는 수익 행렬이고, VI 기반 최적화를 위한 수익 벡터 $ F(z) = (Ay, -A^T x)^T $ 를 정의한다.
- 행동 선택 향상을 위해 평가 중에 온도 스케일링과 argmax 추론을 도입하였으며, $ \tau = 0^+ $ 는 $ \tau = 1.0 $ 에 비해 53% 승률을 기록하였다.
- 파rameterized 전개 전략(p, n, m)을 사용한 MCTS 평가에서, 높은 전개 깊이와 지속 시간이 승률 향상에 기여하지만 샘플 효율성은 감소하는 것으로 나타났다.
실험 결과
연구 질문
- RQ1엔드 투 엔드 딥 강화학습 정책은 두 단계 전략 카드 게임에서 카드 데크 구축과 전투 단계를 효과적으로 통합할 수 있는가?
- RQ2제안된 옵티미스틱 스무스 허위 플레이 알고리즘은 대규모 다단계 게임에서 마지막 반복 수렴을 통해 내쉬 균형에 도달하는가?
- RQ3이 게임 환경에서 동일한 계산 및 시간 예산을 가진 조건에서 MCTS 기반 계획법과 순수 모델-프리 훈련 간의 성능 비교는 어떻게 되는가?
- RQ4온도 스케일링 및 원턴킬(OTK)과 같은 사후 처리 기법이 정책 성능에 얼마나 기여하는가?
- RQ5제안된 방법은 COG2022와 같은 경쟁 기준에서 규칙 기반 또는 별도 단계 접근법을 초월할 수 있는가?
주요 결과
- 제안된 방법은 COG2022 대회에서 LoCM 1.5 및 LoCM 1.2 트랙 모두 1위를 차지하여 뛰어난 경쟁 성능을 입증하였다.
- 평가 중 온도 스케일링을 $ \tau = 0^+ $ 로 설정함으로써 승률이 53%로 향상되었으며, $ \tau = 1.0 $ 에 비해 행동 선택 정밀도 향상이 확인되었다.
- 자원 예산이 동일한 조건에서 MCTS 파aram터 (0.00025, 400, 40) 는 기준선 대비 56% 승률을 기록하여 더 깊은 계획 수단이 성능 향상에 기여함을 보였다.
- 벽시계 시간 기준으로 측정했을 때 MCTS의 성능 향상은 시간이 지남에 따라 감소함을 확인하여 계획 품질과 샘플 효율성 간의 상충 관계를 확인하였다.
- 경쟁 팀에서 OTK를 제거함으로써 승률이 2% 감소한 것으로 나타났으며, 이는 OTK가 강력한 규칙 기반 히어리스틱임을 시사한다. 그러나 본 모델에 대한 OTK의 영향은 미미하여 내재된 체력 계산 능력이 뛰어남을 시사한다.
- 광범위한 아블레이션 및 비교 연구를 통해 엔드 투 엔드 정책과 OSFP 프레임워크가 기준선 및 규칙 기반 방법에 비해 일관되고 측정 가능한 성능 향상을 제공함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.