[논문 리뷰] Modelling Behavioural Diversity for Learning in Open-Ended Games
이 논문은 결정성 점진 과정(DPPs)을 사용하여 게임에서 행동 다양성을 기하학적 프레임워크로 정의하는 방법을 제안한다. 이는 엄밀한 다양성 측도를 정의하며, 최적 반응 동역학에 통합함으로써 나슈 균형과 α-Rank에 수렴하는 다양한 가짜 플레이 및 다양한 정책공간 반응 오라클을 개발한다. 다양한 비이행성 게임 전반에서 PSRO 기반 대비 낮은 탐색 가능성(exploitability)을 달성한다.
Promoting behavioural diversity is critical for solving games with non-transitive dynamics where strategic cycles exist, and there is no consistent winner (e.g., Rock-Paper-Scissors). Yet, there is a lack of rigorous treatment for defining diversity and constructing diversity-aware learning dynamics. In this work, we offer a geometric interpretation of behavioural diversity in games and introduce a novel diversity metric based on determinantal point processes (DPP). By incorporating the diversity metric into best-response dynamics, we develop diverse fictitious play and diverse policy-space response oracle for solving normal-form games and open-ended games. We prove the uniqueness of the diverse best response and the convergence of our algorithms on two-player games. Importantly, we show that maximising the DPP-based diversity metric guarantees to enlarge the gamescape -- convex polytopes spanned by agents' mixtures of strategies. To validate our diversity-aware solvers, we test on tens of games that show strong non-transitivity. Results suggest that our methods achieve at least the same, and in most games, lower exploitability than PSRO solvers by finding effective and diverse strategies.
연구 동기 및 목표
- 다중 에이전트 강화학습 및 게임 이론에서 행동 다양성에 대한 엄밀한 다루움의 부족을 해결하기 위해.
- 결정성 점진 과정(DPPs)을 사용하여 행동 다양성을 기하학적 성질로 형식화함으로써 체계적인 전략 선택을 가능하게 하기 위해.
- 나슈 균형과 α-Rank과 같은 해법 개념에 수렴하는 다양성 인지 학습 동역학을 개발하기 위해.
- 다양성 최적화가 비이행성 게임에서 탐색 가능성의 감소와 게임 스펙트럼의 광범위한 커버리지 달성으로 이어지는지 경험적으로 검증하기 위해.
- PSRO에서의 순환 전략 반복 문제를 극복하기 위해 DPP 기반 다양성 측도를 통합함으로써 새로운 효과적인 전략 탐색을 촉진하기 위해.
제안 방법
- 전략 집합 위에서 DPP의 기대 카디널리티로 정의된 DPP 기반 다양성 측도를 제안하며, 서로 다른 전략 간의 상호 배제를 모델링한다.
- DPP 다양성 측도를 최적 반응 동역학에 통합하여 다양한 가짜 플레이(DFP) 및 다양한 정책공간 반응 오라클(D-PSRO)을 개발한다.
- 다양한 최적 반응는 지ay와 DPP 기반 다양성의 합을 최대화하는 전략으로 정의되며, 이는 이중 게임에서의 유일성과 수렴성을 보장한다.
- 이론적 분석을 통해 DFP가 나슈 균형으로 수렴하고 D-PSRO가 이중 게임에서 α-Rank으로 수렴함을 증명하며, 게임 스펙트럼 확장에 대한 보장을 제공한다.
- 28개의 실제 세계 게임과 합성된 개방형 게임에서 방법을 경험적으로 평가하며, PSRO 및 PSRO rN 기반 대비 탐색 가능성과 다양성에 대해 비교한다.
- 메타게임 추상화를 사용하여 에이전트를 혼합 전략으로 표현함으로써 대규모 정책공간(예: AlphaStar의 888개 정책)에서도 스케일이 잘 되는 평가를 가능하게 한다.
실험 결과
연구 질문
- RQ1기하학적 및 확률적 프레임워크를 사용하여 게임에서 행동 다양성을 공식적으로 정의하고 측정할 수 있는가?
- RQ2DPP 기반 다양성 측도를 최적 반응 동역학에 통합하여 비이행성 게임에서 수렴성과 전략 커버리지 향상을 이룰 수 있는가?
- RQ3DPP 기반 다양성 최적화가 표준 PSRO 대비 낮은 탐색 가능성과 더 넓은 게임 스펙트럼 탐색을 이끌 수 있는가?
- RQ4제안된 다양성 인지 해법이 개방형 게임에서 순환 전략 반복을 피하고 새로운 효과적인 전략을 탐색할 수 있는가?
- RQ5DPP 기반 다양성 측도가 혼합 전략에 의해 스트레칭된 볼륨의 볼록 Hull(게임 스펙트럼)의 확장을 어느 정도 보장하는가?
주요 결과
- 제안된 DPP 기반 다양성 측도는 에이전트의 혼합 전략에 의해 스트레칭된 볼록 Hull(게임 스펙트럼)의 확장을 보장하며, 다양성에 기하학적 근거를 제공한다.
- 다양한 가짜 플레이(DFP)는 이중 게임에서 나슈 균형으로 수렴하며, 다양한 PSRO(D-PSRO)는 이중 게임에서 α-Rank으로 수렴하며 이론적 보장이 있다.
- 888개 정책이 있는 AlphaStar 메타게임에서 D-PSRO는 50개 미만의 정책으로 거의 0에 가까운 탐색 가능성을 달성하며, 포화 상태에 빠지는 PSRO 기반 대비 뛰어난 성능을 보였다.
- 비이행성 혼합 모델에서 DPP-PSRO는 효과적으로 7개의 가우시안 봉우리 모두를 탐색하여 탐색 가능성을 0으로 만들었고, PSRO 및 PSRO rN은 전략 순환으로 실패했다.
- 콜로넬 블로토 게임에서 D-PSRO는 3개의 영역과 10枚의 동전을 가진 10개의 독립 게임 전반에서 PSRO 및 PSRO rN보다 일관되게 낮은 탐색 가능성을 기록했다.
- 무작위로 생성된 0-합 정규형 게임에서 다양한 α-PSRO는 표준 α-PSRO보다 더 안정적인 자기일관성 순환(SSCCs)을 발견하고 더 높은 PCS 점수를 달성했으며, 표준 α-PSRO는 강한 순환 행동을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.