Skip to main content
QUICK REVIEW

[논문 리뷰] Algorithms in Multi-Agent Systems: A Holistic Perspective from Reinforcement Learning and Game Theory

Yunlong Lu, Kai Yan|arXiv (Cornell University)|2020. 01. 17.
Reinforcement Learning in Robotics참고 문헌 87인용 수 12
한 줄 요약

이 종합적 서베이는 다중 에이전트 시스템에서 딥 강화학습(DRL)과 게임 이론을 통합적으로 제시하며, 특히 허구적 자기대칭학습(FSP)과 반사적 위험 최소화(CFR)와 같은 게임 이론적 해법 개념 및 알고리즘들이 딥러닝을 통해 어떻게 적응되고 향상되어 복잡한 다중 에이전트 게임을 해결해 왔는지 강조한다. 주요 기여는 포커, 고, 스타크래프트와 같은 게임에서 초인적 성능을 가능하게 하는 DRL과 게임 이론의 공동 활용을 보여주는 통합 프레임워크이다.

ABSTRACT

Deep reinforcement learning (RL) has achieved outstanding results in recent years, which has led a dramatic increase in the number of methods and applications. Recent works are exploring learning beyond single-agent scenarios and considering multi-agent scenarios. However, they are faced with lots of challenges and are seeking for help from traditional game-theoretic algorithms, which, in turn, show bright application promise combined with modern algorithms and boosting computing power. In this survey, we first introduce basic concepts and algorithms in single agent RL and multi-agent systems; then, we summarize the related algorithms from three aspects. Solution concepts from game theory give inspiration to algorithms which try to evaluate the agents or find better solutions in multi-agent systems. Fictitious self-play becomes popular and has a great impact on the algorithm of multi-agent reinforcement learning. Counterfactual regret minimization is an important tool to solve games with incomplete information, and has shown great strength when combined with deep learning.

연구 동기 및 목표

  • 딥 강화학습(DRL)과 게임 이론이 다중 에이전트 시스템에서 각각 단독으로는 성공에 한계가 있기 때문에, 이 두 분야 간 격차를 메우는 것.
  • 나시 균형, 마르코프-콘리 체인(MCC), 그리고 제한된 합리성과 같은 게임 이론적 해법 개념이 다중 에이전트 RL 알고리즘의 설계와 지도에 어떻게 영향을 주는지 분석하는 것.
  • 허구적 자기대칭학습(FSP)과 반사적 위험 최소화(CFR)와 같은 핵심 알고리즘의 진화와 딥러닝과의 통합을 검토하는 것.
  • DRL을 다중 에이전트 환경에 직접 적용할 때 발생하는 한계, 예를 들어 비마르코프 동역학과 비정적 상태를 다루는 것.
  • 특히 불완전 정보와 높은 복잡도를 지닌 게임에서의 최근 돌파구를 포함한 다중 에이전트 AI에 대한 종합적이고 통합적인 시각을 제공하는 것.

제안 방법

  • 단일 에이전트 강화학습과 다중 에이전트 시스템의 기초 개념을 통합하여 다중 에이전트 학습 과제의 기초를 마련한다.
  • 특히 나시 균형, 마르코프-콘리 체인(MCC), 제한된 합리성과 같은 게임 이론의 해법 개념을 분석하여 정적 균형의 동적 대안으로서 제시한다.
  • 에이전트가 상대방의 평균 전략에 최적으로 대응하는 자기대칭학습(FSP)을 분석하며, 특정 게임에서 나시 균형으로 수렴하는 메커니즘을 설명한다.
  • 불완전 정보 게임을 위한 기반 기반의 알고리즘인 반사적 위험 최소화(CFR)를 상세히 기술하며, 반복 과정에서 반사적 위험를 추적하고 최소화하는 방식을 설명한다.
  • 누적 위험과 평균 전략을 근사하기 위해 신경망을 사용하는 딥 CFR 변종을 제안하여 큰 상태 공간으로의 확장성을 향상시킨다.
  • CFR에 Q-러닝 스타일 업데이트를 통합한 하이브리드 접근법을 제안하여, 종료되지 않는 게임이나 완전 기억이 없는 환경에서도 DRL과의 호환성을 높인다.

실험 결과

연구 질문

  • RQ1나시 균형과 마르코프-콘리 체인(MCC)과 같은 게임 이론적 해법 개념은 다중 에이전트 강화학습 알고리즘의 설계와 평가를 어떻게 향상시킬 수 있는가?
  • RQ2허구적 자기대칭학습(FSP)은 이론적 게임 이론 모델에서 현대 다중 에이전트 RL의 핵심 알고리즘으로 어떻게 진화해 왔는가?
  • RQ3반사적 위험 최소화(CFR)는 어떻게 대규모 불완전 정보 게임을 해결할 수 있으며, 비마르코프 또는 연속적 환경에서의 한계는 무엇인가?
  • RQ4딥 강화학습과 게임 이론 알고리즘을 통합할 때 발생하는 주요 과제는 무엇이며, 최근 방법들은 이를 어떻게 해결해 왔는가?
  • RQ5딥 CFR와 그 변종은 다중 에이전트 RL에서 완전 기억의 제약과 종료 상태 의존성의 한계를 어느 정도 극복할 수 있는가?

주요 결과

  • 허구적 자기대칭학습(FSP)은 현대 다중 에이전트 RL의 기초가 되었으며, 알파제로가 고, 체스, 쇼기에서 초인적 성능을 달성하는 데 기여한 자기대칭 학습 기반의 훈련을 가능하게 하였다.
  • 딥러닝과 결합된 반사적 위험 최소화(CFR)는 텍사스 홀덤 포커와 같은 불완전 정보 게임에서 최첨단 성능을 달성하며 초인적 결과를 이끌어내었다.
  • 위험 및 평균 전략을 근사하기 위해 신경망을 사용하는 딥 CFR 변종은 확장성 면에서 크게 향상되었으며, 특히 두 개의 LSTM을 사용해 위험와 정책을 모델링하는 듀얼 신경망 CFR와 같은 방법이 그 예이다.
  • 선형 및 할인 CFR와 같은 가중치가 부여된 CFR 변종은 최근의 위험 및 전략 업데이트에 중점을 두어 수렴 속도를 향상시키고 근사 오차를 감소시켰다.
  • CFR에 Q-러닝 스타일 업데이트를 통합한 하이브리드 알고리즘은 이전 방법이 실패했던 종료되지 않는 마르코프 게임인 NoSDE에서도 수렴을 가능하게 하였다.
  • 그럼에도 불구하고 딥 CFR 방법은 완전 기억이 없거나 연속적, 종료되지 않는 동역학을 가진 환경에서는 여전히 도전 과제를 안고 있으며, 순환 모델이나 함수 근사와의 추가 통합이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.