Skip to main content
QUICK REVIEW

[논문 리뷰] A Sharp Analysis of Model-based Reinforcement Learning with Self-Play

Qinghua Liu, Tiancheng Yu|arXiv (Cornell University)|2020. 10. 04.
Reinforcement Learning in Robotics참고 문헌 26인용 수 6
한 줄 요약

이 논문은 두 명의 플레이어로 구성된 제로섬 마르코프 게임에 대해 모델 기반 자기대전 알고리즘인 낙관적 내쉬가치반복(Nash-VI)을 제안한다. 이 알고리즘은 샘플 복잡도 $\widetilde{\mathcal{O}}(H^3 S A B / \epsilon^2)$를 달성하며, 정보 이론적 하한선에 비해 $\min\{A,B\}$ 요인 이내로 일치한다. 기존의 모델 기반 방법보다 향상되었고, 최신 모델리스 접근법과 비교해도 효율성이 뛰어나며, 단일 마르코프 정책을 출력함으로써 기존의 복잡한 정책 혼합 구조보다 실용성이 높다.

ABSTRACT

Model-based algorithms -- algorithms that explore the environment through building and utilizing an estimated model -- are widely used in reinforcement learning practice and theoretically shown to achieve optimal sample efficiency for single-agent reinforcement learning in Markov Decision Processes (MDPs). However, for multi-agent reinforcement learning in Markov games, the current best known sample complexity for model-based algorithms is rather suboptimal and compares unfavorably against recent model-free approaches. In this paper, we present a sharp analysis of model-based self-play algorithms for multi-agent Markov games. We design an algorithm -- Optimistic Nash Value Iteration (Nash-VI) for two-player zero-sum Markov games that is able to output an $ε$-approximate Nash policy in $ ilde{\mathcal{O}}(H^3SAB/ε^2)$ episodes of game playing, where $S$ is the number of states, $A,B$ are the number of actions for the two players respectively, and $H$ is the horizon length. This significantly improves over the best known model-based guarantee of $ ilde{\mathcal{O}}(H^4S^2AB/ε^2)$, and is the first that matches the information-theoretic lower bound $Ω(H^3S(A+B)/ε^2)$ except for a $\min\{A,B\}$ factor. In addition, our guarantee compares favorably against the best known model-free algorithm if $\min \{A,B\}=o(H^3)$, and outputs a single Markov policy while existing sample-efficient model-free algorithms output a nested mixture of Markov policies that is in general non-Markov and rather inconvenient to store and execute. We further adapt our analysis to designing a provably efficient task-agnostic algorithm for zero-sum Markov games, and designing the first line of provably sample-efficient algorithms for multi-player general-sum Markov games.

연구 동기 및 목표

  • 다중 에이전트 강화학습에서 모델 기반 및 모델리스 알고리즘 간의 샘플 복잡도 격차를 해소하기 위해.
  • 최적의 샘플 효율성을 확보하는 증명 가능한 효율성 보장이 있는 두 명의 플레이어로 구성된 제로섬 마르코프 게임에 대한 모델 기반 알고리즘을 개발하기 위해.
  • 태스크에 종속되지 않고 샘플 효율적인 알고리즘을 제안하고, 제로섬 게임에 대해 프레임워크를 다수의 플레이어로 일반화된 게임으로 확장하기 위해.
  • 기존의 모델리스 방법이 생성하는 복잡한 정책 혼합을 피하기 위해 단일 마르코프 정책을 출력하기 위해.

제안 방법

  • 낙관적 내쉬가치반복(Nash-VI)을 제안한다. 이는 내쉬가치반복과 신뢰구간을 통합한 모델 기반 자기대전 알고리즘으로, 정책 학습에 활용된다.
  • 일반화된 농도 구간을 사용하여 전이 및 보상 모델의 추정 오차를 제어함으로써 불확실성에 대한 강건성을 확보한다.
  • 모든 단계와 상태에서 진짜 가치함수와 추정 가치함수 간의 차이를 추적하는 새로운 분석 프레임워크를 도입한다.
  • 방문 횟수의 역제곱근에 비례하는 보너스 $\beta_t$ 를 도입하여 탐색과 이용의 균형을 맞춘다.
  • 정책 업데이트 규칙을 수정함으로써 내쉬균형과 상관균형을 모두 처리할 수 있도록 알고리즘을 적응시킨다.
  • 분석을 다수의 플레이어로 구성된 일반화된 게임에 확장하여, 이 분야에서 처음으로 증명 가능한 샘플 효율성 보장이 있는 알고리즘을 설계한다.

실험 결과

연구 질문

  • RQ1모델 기반 알고리즘이 두 명의 플레이어로 구성된 제로섬 마르코프 게임에서 최적의 샘플 복잡도를 달성할 수 있는가?
  • RQ2제안된 알고리즘인 Nash-VI가 샘플 복잡도에 대한 정보 이론적 하한선을 충족하는가?
  • RQ3정책 표현 복잡도를 고려할 때, 모델 기반 방법의 샘플 효율성은 모델리스 방법보다 어떻게 비교되는가?
  • RQ4이 프레임워크는 태스크에 종속되지 않고 다수의 플레이어로 구성된 일반화된 게임으로 확장될 수 있는가?
  • RQ5샘플 효율성을 유지하면서 단일 마르코프 정책을 출력하는 모델 기반 알고리즘을 설계할 수 있는가?

주요 결과

  • 제안된 Nash-VI 알고리즘은 샘플 복잡도 $\widetilde{\mathcal{O}}(H^3 S A B / \epsilon^2)$를 달성하며, 정보 이론적 하한선인 $\Omega(H^3 S (A+B) / \epsilon^2)$에 비해 $\min\{A,B\}$ 요인 이내로 일치한다.
  • 이 샘플 복잡도는 이전의 최고 모델 기반 보장인 $\widetilde{\mathcal{O}}(H^4 S^2 A B / \epsilon^2)$보다 크게 향상되었다.
  • 특정 영역에서 $\min\{A,B\} = o(H^3)$일 경우, 최고의 알려진 모델리스 방법인 Nash V-Learning보다 샘플 효율성이 뛰어나다.
  • Nash-VI는 기존의 모델리스 방법이 생성하는 복잡한 정책 혼합을 피하여 단일 마르코프 정책을 출력한다. 이는 비마르코프적이며 저장 및 실행이 더 어려운 정책 혼합에 비해 실용성이 높다.
  • 분석은 제로섬 게임에 대해 태스크에 종속되지 않은 알고리즘 설계로 확장되었으며, 다수의 플레이어로 구성된 일반화된 게임에 대해 처음으로 증명 가능한 샘플 효율성 보장이 있는 알고리즘을 설계하였다.
  • 내쉬균형과 상관균형 모두에 대해 이론적 보장을 확보하였으며, 일반화된 농도 구간과 유도 기반의 가치함수 추정 오차 한계를 적용하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.