Skip to main content
QUICK REVIEW

[논문 리뷰] Nearly Minimax Optimal Regret for Learning Infinite-horizon Average-reward MDPs with Linear Function Approximation

Yue Wu, Dongruo Zhou|arXiv (Cornell University)|2021. 02. 15.
Reinforcement Learning in Robotics참고 문헌 31인용 수 4
한 줄 요약

이 논문은 선형 함수 근사가 있는 무한 수명 평균 보상 MDPs를 위한 모델 기반 강화 학습 알고리즘인 UCRL2-VTR을 제안한다. 값 대상 회귀와 베르누이 타입 보너스를 통해 UCRL2를 확장함으로써, $ frac{1}{2} frac{1}{2}$의 거의 최소 최대 최적의 손실 한계 $ frac{1}{2} frac{1}{2}$를 달성하며, 이는 로그 요소를 제외한 $ frac{1}{2} frac{1}{2}$의 유도된 하한 $ frac{1}{2} frac{1}{2}$와 일치한다. 이는 이 설정에서 처음으로 이러한 거의 최적의 알고리즘이다.

ABSTRACT

We study reinforcement learning in an infinite-horizon average-reward setting with linear function approximation, where the transition probability function of the underlying Markov Decision Process (MDP) admits a linear form over a feature mapping of the current state, action, and next state. We propose a new algorithm UCRL2-VTR, which can be seen as an extension of the UCRL2 algorithm with linear function approximation. We show that UCRL2-VTR with Bernstein-type bonus can achieve a regret of $ ilde{O}(d\sqrt{DT})$, where $d$ is the dimension of the feature mapping, $T$ is the horizon, and $\sqrt{D}$ is the diameter of the MDP. We also prove a matching lower bound $ ildeΩ(d\sqrt{DT})$, which suggests that the proposed UCRL2-VTR is minimax optimal up to logarithmic factors. To the best of our knowledge, our algorithm is the first nearly minimax optimal RL algorithm with function approximation in the infinite-horizon average-reward setting.

연구 동기 및 목표

  • 선형 함수 근사가 있는 무한 수명 평균 보상 MDPs에서 강화 학습의 손실 최적성 갭을 해소하기 위해.
  • 큰 상태 및 행동 공간에서 선형 구조를 활용하는 증명 가능한 효율적인 알고리즘을 개발하기 위해.
  • 평균 보상 설정 하에서 선형 혼합 MDPs에 대한 상한 및 동일한 하한 손실 한계를 확립하기 위해.
  • 함수 근사가 있는 평균 보상 설정으로 유익성의 불확실성 원칙(OFU)을 확장하기 위해.

제안 방법

  • 전이 동역학을 최소 제곱법을 통해 편향 함수 기대값에 기반해 추정하는 값 대상 회귀를 사용한 UCRL2의 확장인 UCRL2-VTR을 제안한다.
  • 손실 스케일링을 향상시키기 위해 허프딩 타입의 보너스보다 베르누이 타입의 보너스를 탐색에 활용한다.
  • 전이 확률이 상태, 행동, 다음 상태의 특징 매핑에 대해 선형인 선형 혼합 MDPs를 사용한다.
  • 에피소드나 할인된 MDPs와는 다름없는 평균 보상 설정에 특화된 새로운 손실 분해 기법을 적용한다.
  • 모르는 전이 커널을 편향 함수의 경험 기대값을 사용해 추정하는 값 대상 회귀의 변형을 도입한다.
  • 최소 최대 최적성까지 로그 요소를 제외한 $ frac{1}{2} frac{1}{2}$의 하한 $ frac{1}{2} frac{1}{2}$을 유도한다.

실험 결과

연구 질문

  • RQ1모델 기반 강화 학습 알고리즘이 선형 함수 근사가 있는 무한 수명 평균 보상 MDPs에서 거의 최소 최대 최적의 손실 한계를 달성할 수 있는가?
  • RQ2UCRL2-VTR의 손실 한계는 특징 차원 $d$, 시간 수평 $T$, MDP 직경 $D$에 따라 어떻게 변화하는가?
  • RQ3제안된 손실 한계가 로그 요소를 제외한 측면에서 날카로운지, 일치하는 하한을 유도할 수 있는가?
  • RQ4함수 근사가 있는 평균 보상 설정으로, 유익성의 불확실성 원칙을 효과적으로 적응시킬 수 있는가?

주요 결과

  • 베르누이 타입 보너스를 사용한 UCRL2-VTR은 선형 혼합 MDPs에서 손실 한계 $ frac{1}{2} frac{1}{2}$를 달성한다.
  • 이 알고리즘은 $ frac{1}{2} frac{1}{2}$의 유도된 하한 $ frac{1}{2} frac{1}{2}$과 일치하며, 로그 요소를 제외한 거의 최소 최대 최적성임을 확인한다.
  • UCRL2-VTR은 기저 선형 구조를 활용함으로써 실험에서 표본 기반 모델 기반 기준선(예: UCRL, SCAL)을 능가한다.
  • 허프딩 타입 보너스를 사용한 UCRL2-VTR의 경우 $ frac{1}{2} frac{1}{2}$의 손실 한계를 기록하며, 베르누이 변형 대비 열등하다.
  • 이 연구는 무한 수명 평균 보상 MDP 설정에서 함수 근사에 대해 처음으로 거의 최소 최대 최적의 손실 한계를 확립한다.
  • 손실 분석을 위해서는 에피소드나 할인된 MDP 분석과 근본적으로 다름없는 평균 보상 설정에 특화된 새로운 분해 기법이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.