Skip to main content
QUICK REVIEW

[논문 리뷰] Finding Friend and Foe in Multi-Agent Games

Jack Serrino, Max Kleiman‐Weiner|arXiv (Cornell University)|2019. 06. 05.
Artificial Intelligence in Games참고 문헌 40인용 수 18
한 줄 요약

DeepRole는 카운터패널탈리즘 리그레션(CFR)과 딥 밸류 네트워크, 추론을 조합한 다중 에이전트 강화학습 알고리즘으로, 은밀한 역할 게임에서 동료와 적을 식별한다. 5인용 아바론에서, 팀원과 상대 모두에서 인간 플레이어와 기존 에이전트를 능가하며, 해석 가능한 믿음 상태와 자기대전 훈련을 통해 뛰어난 승리 확률을 달성한다.

ABSTRACT

Recent breakthroughs in AI for multi-agent games like Go, Poker, and Dota, have seen great strides in recent years. Yet none of these games address the real-life challenge of cooperation in the presence of unknown and uncertain teammates. This challenge is a key game mechanism in hidden role games. Here we develop the DeepRole algorithm, a multi-agent reinforcement learning agent that we test on The Resistance: Avalon, the most popular hidden role game. DeepRole combines counterfactual regret minimization (CFR) with deep value networks trained through self-play. Our algorithm integrates deductive reasoning into vector-form CFR to reason about joint beliefs and deduce partially observable actions. We augment deep value networks with constraints that yield interpretable representations of win probabilities. These innovations enable DeepRole to scale to the full Avalon game. Empirical game-theoretic methods show that DeepRole outperforms other hand-crafted and learned agents in five-player Avalon. DeepRole played with and against human players on the web in hybrid human-agent teams. We find that DeepRole outperforms human players as both a cooperator and a competitor.

연구 동기 및 목표

  • 역할이 은폐되어 있고 정보가 비대칭적인 다중 에이전트 환경에서 알 수 없는 팀원과 협력하는 데 도전하는 데에 대비하기 위해.
  • 은폐된 역할 게임에서 부분 관측 가능한 행동으로부터 공동 믿음에 대해 추론할 수 있는 AI 에이전트를 개발하기 위해.
  • 협력과 속임수가 공존하는 복잡한 사회적 게임인 더 레지스턴스: 아바론과 같은 환경에서 확장 가능하고 일반화 가능한 다중 에이전트 강화학습을 가능하게 하기 위해.
  • 결정 부수 및 일반화를 향상시키기 위해 승리 확률과 믿음 상태의 해석 가능한 표현을 만들기 위해.
  • 실제 인간-AI 상호작용에서의 에이전트 성능을 평가하여, 훈련 데이터를 초월한 견고성과 적응 능력을 입증하기 위해.

제안 방법

  • 벡터 형태의 CFR와 추론 모듈을 통합하여 관측된 결과와 일관성이 있는 부분 관측 가능한 행동에 기반해 공동 믿음을 추론하고 추론한다.
  • 해석 가능한 승리 확률 표현을 생성하는 제약 조건을 딥 밸류 네트워크에 추가하여 샘플 효율성과 일반화를 향상시킨다.
  • 인간 데이터 없이 정책을 학습할 수 있도록 자기대전 훈련을 활용하여 인간 전략으로의 일반화를 가능하게 한다.
  • 온라인 CFR 반복을 통해 게임 중에 새로운 인간 행동에 적응할 수 있으며, 분포 외의 상황에서도 가능하다.
  • 깊이 제한된 탐색과 제약 조건이 부여된 밸류 네트워크를 적용하여 큰 게임 트리에서 탐색과 이용의 균형을 맞춘다.
  • 믿음 상태 추적을 활용하여 적의 역할 확률을 추정함으로써 시간이 지남에 따라 정확한 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1강화학습 에이전트는 인간의 지시 없이 아바론과 같은 은밀한 역할 게임에서 동료와 적을 식별할 수 있는가?
  • RQ2CFR와 추론의 통합이 부분 관측 하에서 믿음 추론과 의사결정을 얼마나 향상시키는가?
  • RQ3자기대전 훈련을 통해 학습한 에이전트는 혼합된 인간-에이전트 팀에서 실제 인간 플레이어와 경쟁하며 인간과 수작업 에이전트를 모두 능가할 수 있는가?
  • RQ4해석 가능한 믿음 상태는 에이전트의 역할 배정과 팀 역학에 대한 추론 능력을 얼마나 향상시키는가?
  • RQ5제약 조건이 부여된 딥 밸류 네트워크는 복잡하고 부분 관측 가능한 다중 에이전트 환경에서 샘플 효율성과 일반화를 향상시키는가?

주요 결과

  • 5인용 아바론에서, DeepRole는 다른 네 에이전트와 함께 플레이할 때 78.5%의 승리 확률을 기록하여 평균 인간 플레이어를 크게 능가했다.
  • 5인 인간 팀에서 한 명의 인간을 대체했을 때, DeepRole는 팀의 승리 확률을 높여 협력적 팀원으로서의 효과성을 입증했다.
  • ProAvalon.com에서의 혼합 인간-에이전트 게임에서, DeepRole는 팀원으로서 63.4%의 승리 확률, 상대로서 68.1%의 승리 확률을 기록하여 두 역할 모두에서 인간 플레이어를 능가했다.
  • 3번의 미션 통과가 있었을 때, DeepRole의 믿음 상태는 80%의 게임에서 빠르게 진실된 상태에 수렴했으며, 이는 오로지 자기대전 훈련만으로도 가능했다.
  • 에이전트의 해석 가능한 믿음 표현은 시간이 지남에 따라 스파이 역할을 정확하게 추론할 수 있게 했으며, 게임 진행에 따라 더 많은 데이터가 확보될수록 믿음 추정치가 증가했다.
  • 채팅을 처리하거나 자연어를 사용하지 않음에도 불구하고, DeepRole는 협업과 경쟁 모두에서 인간을 능가했으며, 이는 자기대전 훈련을 통한 강력한 일반화 능력을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.