Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond No Regret: Instance-Dependent PAC Reinforcement Learning

Andrew Wagenmaker, Max Simchowitz|arXiv (Cornell University)|2021. 08. 05.
Advanced Bandit Algorithms Research참고 문헌 36인용 수 4
한 줄 요약

이 논문은 PAC 표본형 강화학습을 위한 새로운 인스턴스에 의존하는 샘플 복잡도 측정법인 갭-방문 복잡도를 도입하고, 공격적인 탐색을 가능하게 하여 거의 최소 최대 최적의 샘플 복잡도를 달성하는 계획 기반 방법인 Moca 알고리즘을 제안한다. 저자는 낮은 손실 알고리즘이 이 복잡도를 달성할 수 없음을 입증하며, 손실 최소화와 인스턴스 최적의 정책 식별 사이에 본질적인 상충관계가 있음을 드러낸다.

ABSTRACT

The theory of reinforcement learning has focused on two fundamental problems: achieving low regret, and identifying $ε$-optimal policies. While a simple reduction allows one to apply a low-regret algorithm to obtain an $ε$-optimal policy and achieve the worst-case optimal rate, it is unknown whether low-regret algorithms can obtain the instance-optimal rate for policy identification. We show this is not possible -- there exists a fundamental tradeoff between achieving low regret and identifying an $ε$-optimal policy at the instance-optimal rate. Motivated by our negative finding, we propose a new measure of instance-dependent sample complexity for PAC tabular reinforcement learning which explicitly accounts for the attainable state visitation distributions in the underlying MDP. We then propose and analyze a novel, planning-based algorithm which attains this sample complexity -- yielding a complexity which scales with the suboptimality gaps and the "reachability" of a state. We show our algorithm is nearly minimax optimal, and on several examples that our instance-dependent sample complexity offers significant improvements over worst-case bounds.

연구 동기 및 목표

  • 낮은 손실 알고리즘에서 유도된 온라인-배치 축소가 비생성적이고 표본형 PAC 강화학습에서 엄밀한 인스턴스에 의존하는 보장을 제공할 수 있는지 조사한다.
  • 낙관적인, 손실 최소화 알고리즘이 정책 식별을 위한 인스턴스 최적의 샘플 복잡도를 달성하는 데에 미치는 한계를 규명한다.
  • MDP에서 상태 방문 분포와 부적합성 갭을 고려하는 새로운 인스턴스에 의존하는 복잡도 측정법을 개발한다.
  • 제안된 인스턴스에 의존하는 복잡도 상한을 달성하는 계획 기반 알고리즘을 설계하고 분석한다.
  • 표본형 MDP에서 최적의 정책 식별을 위해 더 공격적이고 비낙관적인 탐색 전략이 필수적임을 보여준다.

제안 방법

  • 방문 확률, 부적합성 갭, 접근 가능성 등을 포함하는 단계, 상태, 행동에 대한 합으로 정의된 새로운 인스턴스에 의존하는 복잡도 측정법인 갭-방문 복잡도를 제안한다.
  • 공격적인 탐색을 통해 관심 있는 상태에 신속히 도달하는 계획 기반 방법인 Moca 알고리즘을 도입하며, 몬테카를로 추정과 동작 제거를 결합하여 부적합한 동작를 식별한다.
  • 비낙관적인 탐색 전략을 활용하여, 부적합한 상태에 도달하고 평가하는 것을 우선시함으로써 정책 식별 속도를 향상시킨다.
  • 상태 방문 분포를 모델링하기 위해 정책의 볼록 조합을 사용하며, 카라테오도리 정리를 활용해 필요한 정책 수를 제한한다.
  • KL 발산과 측도 변화 추론을 활용해 정보 이론적 하한을 도출함으로써 샘플 복잡도의 기본 한계를 규명한다.
  • 알고리즘의 샘플 복잡도가 Õ(C(M,ε)·log(1/δ))로 스케일링됨을 증명하며, 이는 거의 최소 최대 최적임을 보여준다.

실험 결과

연구 질문

  • RQ1낮은 손실 알고리즘은 표본형 MDP에서 PAC 정책 식별을 위한 인스턴스 최적의 샘플 복잡도를 달성할 수 있는가?
  • RQ2낮은 손실을 달성하는 것과 동시에 인스턴스 최적의 속도로 ϵ-최적의 정책을 식별하는 데에 있어 본질적인 상충관계는 무엇인가?
  • RQ3부적합성 갭과 상태 접근 가능성의 상호작용을 반영하는 새로운 PAC RL 샘플 복잡도 측정법이 존재하는가?
  • RQ4비낙관적이고 계획 기반 알고리즘이 인스턴스에 의존하는 샘플 복잡도 측면에서 낙관적, 손실 최소화 접근 방식을 능가할 수 있는가?
  • RQ5표본형 MDP에서 δ-정확한 정책 식별을 위한 샘플 복잡도의 기본 한계는 무엇인가?

주요 결과

  • 갭-방문 복잡도 측정법 C(M,ε)는 최소 최대 최적의 PAC 비율보다 크지 않으며, 특정 경우에 인스턴스 최적의 복잡도와 일치한다.
  • Moca 알고리즘은 Õ(C(M,ε)·log(1/δ)) 에피소드 내에 δ-정확한 정책 식별을 달성하며, 거의 최소 최대 최적이다.
  • 낮은 손실 알고리즘은 제안된 갭-방문 복잡도를 달성할 수 없으며, 특히 부적합한 동작가 자주 방문되지 않을 경우 샘플 복잡도 측면에서 극단적으로 열 劣하다.
  • 모토레이팅 예시에서 Moca는 s₂에서 최적의 동작을 Õ(1/Δ²) 에피소드 내에 식별하지만, 낮은 손실 알고리즘은 Ω(1/(pΔ²)) 에피소드가 필요하여, p가 작을수록 임의로 향상됨을 보여준다.
  • 하한 분석을 통해 모든 s,a에 대해 E[τ] ≥ (1/(6·gap(s,a)²·w^π_h(s,a)))·log(1/(2.4δ)) 를 만족해야 하며, 이는 샘플 효율성에 대한 본질적 한계를 설정한다.
  • 분석을 통해 최적의 정책이 항상 낙관적 탐색에 의해 발견되는 것은 아니며, 비낙관적이고 접근 가능성 인지 기반의 계획이 인스턴스 최적의 학습에 필수적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.