Skip to main content
QUICK REVIEW

[논문 리뷰] Independent Learning in Stochastic Games

Asuman Ozdaglar, Muhammed O. Sayin|arXiv (Cornell University)|2021. 11. 23.
Advanced Bandit Algorithms Research참고 문헌 71인용 수 4
한 줄 요약

이 논문은 협력이 없는 에이전트 간의 수렴 보장이 가능한 제로섬 스토케스틱 게임을 위한 새로운 독립적 학습 역학을 제안한다. 비대칭 단계 크기를 사용한 최적 반응 업데이트를 통해 가상의 플레이를 동적 환경으로 확장함으로써, 모델 기반, 모델리스, 최소 정보 설정 모두에서 수렴을 달성하며, 비협력적 다중 에이전트 강화 학습의 분리된 해결책을 제공한다.

ABSTRACT

Reinforcement learning (RL) has recently achieved tremendous successes in many artificial intelligence applications. Many of the forefront applications of RL involve multiple agents, e.g., playing chess and Go games, autonomous driving, and robotics. Unfortunately, the framework upon which classical RL builds is inappropriate for multi-agent learning, as it assumes an agent's environment is stationary and does not take into account the adaptivity of other agents. In this review paper, we present the model of stochastic games for multi-agent learning in dynamic environments. We focus on the development of simple and independent learning dynamics for stochastic games: each agent is myopic and chooses best-response type actions to other agents' strategy without any coordination with her opponent. There has been limited progress on developing convergent best-response type independent learning dynamics for stochastic games. We present our recently proposed simple and independent learning dynamics that guarantee convergence in zero-sum stochastic games, together with a review of other contemporaneous algorithms for dynamic multi-agent learning in this setting. Along the way, we also reexamine some classical results from both the game theory and RL literature, to situate both the conceptual contributions of our independent learning dynamics, and the mathematical novelties of our analysis. We hope this review paper serves as an impetus for the resurgence of studying independent and natural learning dynamics in game theory, for the more challenging settings with a dynamic environment.

연구 동기 및 목표

  • 고전적 강화 학습이 정적 환경을 가정하는 바, 스토케스틱 게임에서 수렴 가능한 독립적 학습 역학의 부족을 해결하기 위해.
  • 상대방의 목표를 알 필요 없이 협력 없이도 작동하는 분산 학습 규칙을 개발하기 위해.
  • 가상의 플레이 유형의 역학을 제로섬 스토케스틱 게임과 같은 비정적, 비정적 전환을 포함하는 동적 환경으로 확장하기 위해.
  • 모델 기반, 모델리스, 최소 정보 설정 등 다양한 정보 설정에서 수렴 보장을 수립하기 위해.
  • 최적 반응 역학과 스토케스틱 게임 이론을 융합하여 게임 이론과 강화 학습을 연결하기 위해.

제안 방법

  • 각 에이전트가 상대방의 과거 행동에 대한 경험적 추정치를 기반으로 전략을 업데이트하는 가상의 플레이를 모방한 학습 규칙을 제안한다.
  • 한 에이전트가 다른 에이전트보다 더 빠르게 업데이트되도록 비대칭 단계 크기를 사용하여 제로섬 스토케스틱 게임에서의 수렴을 보장한다.
  • 완전한 모델 지식, 부분적 모델 지식, 상대방 행동 관측의 최소 수준이라는 세 가지 정보 영역에서 동역학을 적용한다.
  • 학습 중에 제로섬 구조를 유지하기 위해 연속 시간 임베딩에서 계속 보상 메커니즘을 활용한다.
  • 동적 전이와 보상 추정을 다룰 수 있도록 게임 이론과 강화 학습의 아이디어를 통합한다.
  • 스토케스틱 근사와 리아푸노프 기반 기법을 사용하여 수렴성을 분석함으로써 점점 수렴이 나아가는 나슈 균형에 도달함을 보장한다.

실험 결과

연구 질문

  • RQ1협력 없이도 독립적이고 최적 반응 유형의 학습 역학이 제로섬 스토케스틱 게임에서 수렴할 수 있는가?
  • RQ2가상의 플레이는 비정적 전환을 포함하는 동적 환경으로 어떻게 확장될 수 있는가?
  • RQ3에이전트가 상대방의 전략이나 보상 함수에 대해 제한된 정보 또는 전혀 알지 못하는 상황에서 어떤 학습 보장이 가능할 수 있는가?
  • RQ4무한 시간 할인 스토케스틱 게임에서 분산 학습 역학이 수렴을 달성할 수 있는가?
  • RQ5비대칭 업데이트 속도는 경쟁적이고 동적 환경에서 학습을 안정화시키는 데 어떤 역할을 하는가?

주요 결과

  • 제안된 독립적 학습 역학은 모든 세 가지 정보 설정(모델 기반, 모델리스, 최소 정보)에서 제로섬 스토케스틱 게임에서 나슈 균형으로 수렴한다.
  • 최소 정보 설정에서 상대방의 행동을 관측하지 않더라도, 또는 상대방의 목표를 알지 못해도 수렴이 보장된다.
  • 비대칭 단계 크기의 사용이 수렴 가능성을 보장하며, 대칭적이거나 협력적인 업데이트 규칙은 수렴하지 못할 수 있음에 비해 유리하다.
  • 이 방법은 스토케스틱 게임에서 완전히 분산되고 독립적인 학습에 대한 첫 번째 수렴 보장을 제공하여 오랫동안 존재하던 문헌의 격차를 메운다.
  • 분석은 연속 시간 임베딩으로 확장되며, 시간 평균 계속 보상 메커니즘을 통해 제로섬 구조를 유지하면서 수렴을 확립한다.
  • 이 프레임워크는 모델 불확실성에 강건하며, 알려지지 않은 전이 확률과 보상 함수를 가진 환경에서도 학습을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.