Skip to main content
QUICK REVIEW

[논문 리뷰] Online Reinforcement Learning in Stochastic Games

Chen-Yu Wei, Yi-Te Hong|arXiv (Cornell University)|2017. 12. 02.
Advanced Bandit Algorithms Research참고 문헌 10인용 수 7
한 줄 요약

이 논문은 평균 보상 스토케스틱 게임에서 온라인 강화학습을 위한 UCSG 알고리즘을 제안하며, 낙관주의와 상대의 비정상적인 정책을 정상적인 정책으로 대체하는 새로운 기법을 활용하여 임의의 상대방에 대해 비선형 회귀를 달성한다. 주요 기여는 평균 보상 설정에서 ε-최대최소 정상 정책을 찾는 데 대해 Õ(DS²A/ε³)의 샘플 복잡도 한계를 제공하는 것으로, 이는 할인율이 없고 에피소드가 없는 설정에서 이전 연구를 향상시킨다.

ABSTRACT

We study online reinforcement learning in average-reward stochastic games (SGs). An SG models a two-player zero-sum game in a Markov environment, where state transitions and one-step payoffs are determined simultaneously by a learner and an adversary. We propose the UCSG algorithm that achieves a sublinear regret compared to the game value when competing with an arbitrary opponent. This result improves previous ones under the same setting. The regret bound has a dependency on the diameter, which is an intrinsic value related to the mixing property of SGs. If we let the opponent play an optimistic best response to the learner, UCSG finds an $\varepsilon$-maximin stationary policy with a sample complexity of $ ilde{\mathcal{O}}\left( ext{poly}(1/\varepsilon) ight)$, where $\varepsilon$ is the gap to the best policy.

연구 동기 및 목표

  • 평균 보상, 비에피소드 설정에서 이인자 제로섬 스토케스틱 게임에서 온라인 강화학습을 다루기 위해.
  • 임의의 상대방과 대응할 때 게임의 가치에 대해 비선형 회귀를 달성하는 알고리즘을 개발하기 위해.
  • 평균 보상 설정에서 ε-최대최소 정상 정책을 찾는 데 대해 Õ(poly(1/ε))의 샘플 복잡도 한계를 제공하기 위해.
  • 회귀 분석에서 상대의 비정상성과 통제 불능성으로 인한 과제를 해결하기 위해, 이는 표준 MDP 기반의 변동 기법을 무효화한다.

제안 방법

  • 불확실성에 대한 낙관주의를 활용하여 탐색과 이용을 균형 잡는 UCSG 알고리즘을 제안하며, 수동 하이퍼파라미터 조정이 필요 없다.
  • 상대의 비정상 정책을 정상 정책으로 대체하는 새로운 분석 기법을 도입하여, 변동 기반 분석의 사용을 가능하게 한다.
  • 지름 기반의 경계를 활용한 제약 최적화 접근법을 통해 낙관적인 모델을 선택하며, 진짜 모델이 타당해지도록 보장한다.
  • 집중 부등식과 상태-행동 가치 함수 분해를 활용하여 에피소드 간의 회귀 항을 제한한다.
  • 회귀를 여섯 개의 구성 요소로 계층적으로 분해하며, 주요 항들은 레이마 I.1과 정리 K.1을 통해 분석된다.
  • 혼합 시간을 제어하고 회귀 성장률을 조절하기 위해 지름 D를 핵심 구조적 매개변수로 활용한다.

실험 결과

연구 질문

  • RQ1임의의 상대방에 대해 평균 보상 스토케스틱 게임에서 온라인 강화학습에서 비선형 회귀를 달성할 수 있는가?
  • RQ2할인율이 없고 에피소드가 없는 설정에서 ε-최대최소 정상 정책을 학습하는 데 최적의 샘플 복잡도는 무엇인가?
  • RQ3비정상적인 상대 행동을 어떻게 분석적으로 다룰 수 있을까? 이는 MDP 기반의 회귀 분석을 스토케스틱 게임으로 확장하기 위해 필수적이다.
  • RQ4할인 요소에 의존하지 않고 지름 D와 같은 구조적 매개변수에만 의존하는 것으로 회귀 한계를 향상시킬 수 있는가?
  • RQ5고정된 수평 기간 계획 후에만 출력되는 것과 달리, 학습의 어느 단계에서나 현재 최선의 정상 정책을 출력할 수 있는가?

주요 결과

  • UCSG 알고리즘은 평균 보상 스토케스틱 게임에서 ε-최대최소 정상 정책을 찾는 데 대해 Õ(DS²A/ε³)의 회귀 한계를 달성한다.
  • 회귀는 단계 수에 대해 비선형이며, 주요 항은 지름 D와 상태-행동 공간 크기 S와 A에서 기인한다.
  • ε-최적성 달성을 위한 샘플 복잡도는 Õ(DS²A/ε³)이며, 이는 평균 보상, 비에피소드 설정에서 처음으로 제시된 한계이다.
  • 기존 방법이 고정된 수평 기간 계획 후에만 출력하는 것과 달리, 알고리즘은 학습 중 어느 시점에서나 현재 최선의 정상 정책을 출력한다.
  • 상대의 비정상 정책을 정상 정책으로 대체하는 제안된 방법은 변동 분석의 사용을 가능하게 하여, 다중 에이전트 강화학습에서의 핵심 과제를 해결한다.
  • 이 한계는 할인 요소에 독립적이므로, 할인 모델이 부적절한 장기 수평 기간 계획 과제에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.