Skip to main content
QUICK REVIEW

[논문 리뷰] Posterior Sampling for Reinforcement Learning Without Episodes

Ian Osband, Benjamin Van Roy|arXiv (Cornell University)|2016. 08. 09.
Advanced Bandit Algorithms Research참고 문헌 7인용 수 8
한 줄 요약

이 논문은 비에피소딕, 무한할행 MDP에서 후행 샘플링 강화 학습(PSRL)의 리그레트 한계 증명에 대한 심각한 결함을 규명하며, 특히 Abbasi-Yadkori & Szepesvári (2015)의 정리 2의 타당성을 도전한다. 논문은 잘못된 추론에 대한 반례를 제시하고, 결과를 추측으로 재분류하며, 인위적 에피소드 길이, 듀블링 기법, 매끄러운 후행 샘플링과 같은 실용적 전략을 제안하여 연속적인 비에피소딕 환경에서 PSRL를 효과적으로 적용할 수 있도록 한다.

ABSTRACT

This is a brief technical note to clarify some of the issues with applying the application of the algorithm posterior sampling for reinforcement learning (PSRL) in environments without fixed episodes. In particular, this paper aims to: - Review some of results which have been proven for finite horizon MDPs (Osband et al 2013, 2014a, 2014b, 2016) and also for MDPs with finite ergodic structure (Gopalan et al 2014). - Review similar results for optimistic algorithms in infinite horizon problems (Jaksch et al 2010, Bartlett and Tewari 2009, Abbasi-Yadkori and Szepesvari 2011), with particular attention to the dynamic episode growth. - Highlight the delicate technical issue which has led to a fault in the proof of the lazy-PSRL algorithm (Abbasi-Yadkori and Szepesvari 2015). We present an explicit counterexample to this style of argument. Therefore, we suggest that the Theorem 2 in (Abbasi-Yadkori and Szepesvari 2015) be instead considered a conjecture, as it has no rigorous proof. - Present pragmatic approaches to apply PSRL in infinite horizon problems. We conjecture that, under some additional assumptions, it will be possible to obtain bounds $O( \sqrt{T} )$ even without episodic reset. We hope that this note serves to clarify existing results in the field of reinforcement learning and provides interesting motivation for future work.

연구 동기 및 목표

  • 무한할행 MDP에서 PSRL의 리그레트 한계 증명에 있는 기술적 결함을 규명하고 수정하는 것.
  • Abbasi-Yadkori와 Szepesvári (2015)의 정리 2의 타당성을 도전하는 것 — 이는 비에피소딕 환경에서 게으른-PSRL 버전이 O(√T) 리그레트를 보인다고 주장한다.
  • 고정된 에피소드 경계가 없는 환경에서 PSRL를 효과적으로 적용하기 위한 실용적이고 경험적으로 효과적인 방법을 제공하는 것.
  • 에피소딕에서 비에피소딕 강화 학습 설정으로의 이론적 보장을 확장하는 데 향후 연구를 자극하는 것.

제안 방법

  • Abbasi-Yadkori와 Szepesvári (2015)의 잘못된 추론에 대한 반례를 구성하여, 주장된 바와 같이 기대 리그레트가 0이 될 수 없음을 입증한다.
  • 확장된 상태 공간을 가진 유한할행 MDP의 특수한 경우로 간주함으로써, 무한할행 MDP 환경에서 PSRL 알고리즘을 재해석한다.
  • 비에피소딕 환경에 대한 PSRL의 실용적 변형을 제안하며, 자연스러운 시간 틀이나 할인을 기반으로 한 인위적 에피소드 길이를 도입한다.
  • 시간에 따라 MDP 샘플을 선형으로 보간하여 급격한 정책 변화를 방지하는 매끄러운 후행 샘플링 접근법을 도입한다.
  • 최적 정책의 수명이 알려져 있지 않을 경우, 동적 에피소드 길이 적응을 위해 '듀블링 기법'을 권고한다.
  • MDP 매개변수에 대한 베이지안 후행분포를 사용하고, 현재와 과거의 후행 샘플을 가중 평균으로 조합하여 정책 선택의 안정성을 높인다.

실험 결과

연구 질문

  • RQ1Abbasi-Yadkori와 Szepesvári (2015)의 정리 2에서 비에피소딕 MDP에서 PSRL의 리그레트 한계에 대한 증명에 있는 결함은 무엇인가?
  • RQ2조건부 독립성에 기반해 기대 리그레트가 0이 된다는 추론은 무한할행 설정에서 타당한가?
  • RQ3추가 가정 하에 PSRL을 사용해 비에피소딕 MDP에서 O(√T) 리그레트를 달성할 수 있는가?
  • RQ4고정된 에피소드 경계가 없는 환경에서 PSRL를 효과적으로 적용하기 위한 실용적 전략은 무엇인가?
  • RQ5에피소드 경계가 인위적이거나 동적으로 변화할 경우, 후행 샘플링은 어떻게 적응하여 안정성과 성능을 유지할 수 있는가?

주요 결과

  • Abbasi-Yadkori와 Szepesvári (2015)의 정리 2에서 잘못된 증명에 대한 반례를 구성하여, E[λ* - λk(t)k(t) | Hk(t)1] = 0이라고 주장한 바와 같이 기대 리그레트가 0이 될 수 없다고 입증한다.
  • 반례는 Hmax=1000일 때 T=1000단위 시간 동안 최소 249의 리그레트를 보이며, 기대 리그레트가 0이라는 주장에 반박한다.
  • Abbasi-Yadkori와 Szepesvári (2015)의 정리 2 증명은 조건부 기대의 잘못된 사용으로 인해 무효하며, 이 결과는 추측으로 간주되어야 한다.
  • 엄밀한 리그레트 한계가 없음에도 불구하고 경험적 증거는 PSRL이 비에피소딕 설정에서 잘 작동함을 시사하며, 추가 가정 하에 결과가 여전히 참일 수 있음을 시사한다.
  • 인위적 에피소드 길이, 듀블링 기법, 매끄러운 후행 샘플링과 같은 실용적 접근법은 에피소드 리셋 없이 PSRL를 적용하는 데 실제로 효과적이다.
  • 비에피소딕 설정으로의 O(√T) 리그레트 한계 이론적 확장은 여전히 열려 있는 문제이지만, 본 논문은 이 분야의 향후 연구에 기초를 마련한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.