Skip to main content
QUICK REVIEW

[논문 리뷰] Towards General Function Approximation in Zero-Sum Markov Games

Baihe Huang, Jason D. Lee|arXiv (Cornell University)|2021. 07. 30.
Reinforcement Learning in Robotics참고 문헌 53인용 수 4
한 줄 요약

이 논문은 일반 함수 근사가 있는 이인자 제로섬 마르코프 게임에 대해 증명 가능하게 효율적인 알고리즘을 제안하며, 함수 클래스 복잡도를 측정하기 위해 Minimax Eluder 차원을 도입한다. 선형 함수 설정에서 이전 작업 대비 √d 요소를 향상시켜 개선된 리그레트 한계를 달성하고, 일반화된 워치맨 랭크를 통해 표본 복잡도 한계를 설정함으로써 신경망과 일반화된 선형 모델을 사용하는 분리된 설정과 조율된 설정 모두에서 표본 효율적인 학습을 가능하게 한다.

ABSTRACT

This paper considers two-player zero-sum finite-horizon Markov games with simultaneous moves. The study focuses on the challenging settings where the value function or the model is parameterized by general function classes. Provably efficient algorithms for both decoupled and {coordinated} settings are developed. In the {decoupled} setting where the agent controls a single player and plays against an arbitrary opponent, we propose a new model-free algorithm. The sample complexity is governed by the Minimax Eluder dimension -- a new dimension of the function class in Markov games. As a special case, this method improves the state-of-the-art algorithm by a $\sqrt{d}$ factor in the regret when the reward function and transition kernel are parameterized with $d$-dimensional linear features. In the {coordinated} setting where both players are controlled by the agent, we propose a model-based algorithm and a model-free algorithm. In the model-based algorithm, we prove that sample complexity can be bounded by a generalization of Witness rank to Markov games. The model-free algorithm enjoys a $\sqrt{K}$-regret upper bound where $K$ is the number of episodes.

연구 동기 및 목표

  • 일반 함수 근사가 있는 경쟁적 강화학습의 이론과 실천 간 격차를 메우기 위해.
  • 분리된 설정과 조율된 설정 모두에서 제로섬 마르코프 게임에 대해 증명 가능하게 효율적인 알고리즘을 개발하기 위해.
  • 경쟁 환경에서의 함수 클래스를 위한 새로운 복잡도 측정 기준인 Minimax Eluder 차원과 일반화된 워치맨 랭크를 도입하기 위해.
  • 상태 공간 크기와 무관한 표본 복잡도 및 리그레트 한계를 확립하기 위해.
  • 분포 이탈 문제에 직면한 다중 에이전트 마르코프 게임로 옵timistic 플래닝 원리를 확장하기 위해.

제안 방법

  • 제로섬 마르코프 게임에서 함수 클래스의 복잡도 측정 기준으로 새로운 복잡도 측정 기준인 Minimax Eluder 차원을 도입한다.
  • 분포 이탈을 관리하기 위해 교대적 옵티미즘과 제약 집합을 사용하는 분리된 설정에서의 모델리스 알고리즘을 제안한다.
  • 표본 복잡도를 제한하기 위해 일반화된 워치맨 랭크를 사용하는 조율된 설정에서의 모델기반 알고리즘을 개발한다.
  • 전역적 옵티미즘과 제약 집합, 타원형 잠재력 논증을 활용해 추정 오차를 제어하고 옵티미즘을 보장한다.
  • 누적 오차 제어와 타원형 잠재력 보조정을 사용해 리그레트를 제한하고 수렴을 보장한다.
  • 다중 에이전트 상호작용을 다루기 위해 MDP에서의 농도 및 정보 획득 방법을 마르코프 게임으로 확장한다.

실험 결과

연구 질문

  • RQ1일반 함수 근사가 있는 제로섬 마르코프 게임에 대해 증명 가능하게 효율적인 알고리즘을 개발할 수 있는가?
  • RQ2마르코프 게임에서 옵티미즘은 어떻게 적응시켜 분포 이탈을 방지하고 수렴을 보장할 수 있는가?
  • RQ3함수 근사가 있는 경쟁적 강화학습에서 표본 효율성을 특성화하기 위해 어떤 새로운 복잡도 측정 기준이 필요한가?
  • RQ4Minimax Eluder 차원은 커버링 수와 워치맨 랭크와 같은 기존 측정 기준과 어떻게 관련이 있는가?
  • RQ5제안된 알고리즘은 상태 공간 크기와 무관한 리그레트 및 표본 복잡도 한계를 달성할 수 있는가?

주요 결과

  • 분리된 설정에서의 모델리스 알고리즘은 Õ(H√(d_E K log N_F))의 리그레트 한계를 달성한다. 여기서 d_E는 Minimax Eluder 차원이고 N_F는 함수 클래스의 커버링 수이다.
  • d차원 특징을 가진 선형 함수 근사 설정에서, 이전 작업 대비 √d 요소를 향상시켜 리그레트가 개선된다.
  • 조율된 설정에서 모델기반 알고리즘은 ε-근접한 내쉬 균형에 도달하기 위해 Õ(H³W²/ε²)개의 표본이 필요하다. 여기서 W는 일반화된 워치맨 랭크이다.
  • 조율된 설정에서의 모델리스 알고리즘은 Õ(H√(dK log(N_F N_Π)))의 리그레트를 유발한다. 여기서 d는 Minimax Eluder 차원의 변종이고 N_Π는 정책 클래스의 커버링 수이다.
  • 표본화된 게임(Õ(|S||A|²))과 과잉 매개변수화된 신경망(NTK 영역에서 임계 정보 수확에 의해)에서 Minimax Eluder 차원은 유계이다.
  • 일반화된 선형 모델의 경우, 표준 정규 조건 하에서 Minimax Eluder 차원은 O(d(c₂/c₁)² log(c₂R/(c₁ε)))로 유계이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.