Skip to main content
QUICK REVIEW

[논문 리뷰] Provably Efficient $Q$-learning with Function Approximation via Distribution Shift Error Checking Oracle

Simon S. Du, Yuping Luo|arXiv (Cornell University)|2019. 06. 14.
Reinforcement Learning in Robotics참고 문헌 40인용 수 9
한 줄 요약

이 논문은 확률적 에피소딕 MDP에서 선형 함수 근사와 함께 Q-학습을 위한 증명 가능하게 효율적인 알고리즘인 차분 최대화 Q-학습(DMQ)을 제안한다. 분포 이탈 오차 검사(DSEC) 오라클을 도입함으로써 새로운 탐색이 일반화를 향상시킬 때를 감지함으로써, DMQ는 정규성 가정 하에 다항 수준의 샘플 복잡도와 ϵ-최적 정책 수렴을 보장한다.

ABSTRACT

$Q$-learning with function approximation is one of the most popular methods in reinforcement learning. Though the idea of using function approximation was proposed at least 60 years ago, even in the simplest setup, i.e, approximating $Q$-functions with linear functions, it is still an open problem on how to design a provably efficient algorithm that learns a near-optimal policy. The key challenges are how to efficiently explore the state space and how to decide when to stop exploring in conjunction with the function approximation scheme. The current paper presents a provably efficient algorithm for $Q$-learning with linear function approximation. Under certain regularity assumptions, our algorithm, Difference Maximization $Q$-learning (DMQ), combined with linear function approximation, returns a near-optimal policy using a polynomial number of trajectories. Our algorithm introduces a new notion, the Distribution Shift Error Checking (DSEC) oracle. This oracle tests whether there exists a function in the function class that predicts well on a distribution $\mathcal{D}_1$, but predicts poorly on another distribution $\mathcal{D}_2$, where $\mathcal{D}_1$ and $\mathcal{D}_2$ are distributions over states induced by two different exploration policies. For the linear function class, this oracle is equivalent to solving a top eigenvalue problem. We believe our algorithmic insights, especially the DSEC oracle, are also useful in designing and analyzing reinforcement learning algorithms with general function approximation.

연구 동기 및 목표

  • 확률적 MDP에서 함수 근사를 갖는 증명 가능하게 효율적인 Q-학습 알고리즘 설계라는 오랜 동안 미해결된 문제를 해결한다.
  • 함수 근사 설정에서 효율적인 탐색과 적시 종료의 이중 과제를 극복한다.
  • 선형 함수 클래스를 사용하여 샘플 효율성과 근사 최적 정책 수렴에 대한 이론적 보장을 제공한다.
  • 다양한 정책에 의해 유도되는 상태 분포의 분포 이탈을 기반으로 하는 적응적 탐색을 가능하게 하는 새로운 알고리즘 원천인 DSEC 오라클을 도입한다.

제안 방법

  • 새로운 분포 이탈 오차 검사(DSEC) 오라클을 사용하여 새로운 탐색이 유익한 시점을 감지하는 차분 최대화 Q-학습(DMQ) 알고리즘을 제안한다.
  • DSEC 오라클을 정의하여, 특정 함수 클래스가 현재 정책의 분포에서는 잘 예측하지만, 새로운 탐색 정책의 분포에서는 잘 예측하지 못하는지를 테스트하는 것으로 한다.
  • 선형 함수 클래스의 경우, DSEC 오라클은 최상위 고유값 문제를 해결하는 것으로 간소화되어 효율적인 계산이 가능하다.
  • 상태 분포의 공분산 행렬을 기반으로 한 잠재 함수 접근법을 사용하여 DSEC 오라클이 '참'을 반환하는 횟수를 근사한다.
  • 고전적인 선형 회귀 분석을 활용하여 현재 정책의 상태 분포 하에서 정확한 Q-값 추정을 보장한다.
  • 오라클 피드백과 정책 개선 단계를 조합하여 탐색된 정책 집합을 반복적으로 확장함으로써, 과도한 탐색 없이 수렴을 보장한다.

실험 결과

연구 질문

  • RQ1확률적 에피소딕 MDP에서 선형 함수 근사를 갖는 증명 가능하게 효율적인 Q-학습 알고리즘을 설계할 수 있는가?
  • RQ2함수 근사를 통한 상태 간 일반화를 확보하면서 상태 공간을 효율적으로 탐색할 수 있는가?
  • RQ3함수 근사가 분포 간 잘못된 일반화를 일으킬 수 있으므로, 언제 탐색을 중단할 수 있는가?
  • RQ4DSEC 오라클은 유용한 새로운 정보를 나타내는 분포 이탈을 감지하는 데 사용될 수 있으며, 수렴 전까지 몇 번의 이러한 이탈이 발생할 수 있는가?
  • RQ5선형 함수 클래스의 맥락에서 잠재 함수 접근법을 사용하여 탐색 단계 수를 근사할 수 있는가?

주요 결과

  • 정규성 가정 하에, DMQ는 다항 수준의 샘플 수(즉, poly(1/ϵ))의 트레이젝터리로 ϵ-하위최적 정책을 반환하며, 이는 확률적 환경에서 선형 함수 근사를 갖는 첫 번째 증명 가능하게 효율적인 Q-학습 알고리즘이다.
  • 선형 함수 클래스에 대해 DSEC 오라클은 최대 다항 수준의 횟수만 '참'을 반환함을 입증하여, 탐색이 유한하고 유계임을 보장한다.
  • 공분산 행렬을 기반으로 한 잠재 함수 접근법은 탐색 중에 추가되는 서로 다른 정책의 수가 다항 수준으로 유계임을 증명한다.
  • 알고리즘은 다항 시간 내에 실행되며, 1/ϵ(원하는 정확도의 역수)에 대해 다항 수준으로 샘플 복잡도가 스케일링된다.
  • 이론적 프레임워크는 선형 함수를 초월하여 일반화 가능하다: DSEC 오라클과 알고리즘 아키텍처는 VC 차원이 유계인 일반 함수 클래스에도 적용 가능하다.
  • 논문은 과도하게 파rameter화된 신경망이 작은 재생 힐버트 공간 노름을 갖는 커널 예측기로 분석될 수 있음을 시사함으로써, 증명 가능한 보장을 딥 Q-학습으로 확장하는 기초를 마련한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.