Skip to main content
QUICK REVIEW

[논문 리뷰] Frequentist Regret Bounds for Randomized Least-Squares Value Iteration

Andrea Zanette, David Brandfonbrener|arXiv (Cornell University)|2019. 11. 01.
Advanced Bandit Algorithms Research참고 문헌 34인용 수 17
한 줄 요약

이 논문은 선형 함수 근사와 함께 유한한 수명 주기 강화 학습을 위한 랜덤화된 최소 제곱가치 반복(RLSVI)의 낙관적으로 초기화된 변종을 제안한다. 저랭크 전이 동역학 하에서, 이는 $\widetilde{O}(d^2H^2\sqrt{T})$의 첫 번째 빈도주의 회귀 분석 결과를 확립하여, 대규모 MDP에서 기능 근사를 통한 랜덤화 탐색에 대한 이론적 보장을 제공한다.

ABSTRACT

We consider the exploration-exploitation dilemma in finite-horizon reinforcement learning (RL). When the state space is large or continuous, traditional tabular approaches are unfeasible and some form of function approximation is mandatory. In this paper, we introduce an optimistically-initialized variant of the popular randomized least-squares value iteration (RLSVI), a model-free algorithm where exploration is induced by perturbing the least-squares approximation of the action-value function. Under the assumption that the Markov decision process has low-rank transition dynamics, we prove that the frequentist regret of RLSVI is upper-bounded by $\widetilde O(d^2 H^2 \sqrt{T})$ where $ d $ are the feature dimension, $ H $ is the horizon, and $ T $ is the total number of steps. To the best of our knowledge, this is the first frequentist regret analysis for randomized exploration with function approximation.

연구 동기 및 목표

  • 대규모 강화 학습에서 기능 근사를 통한 랜덤화 탐색 알고리즘에 대한 빈도주의 회귀 분석 부족을 해결한다.
  • RLSVI와 같이 실험적으로 효과적인 랜덤화 알고리즘과 비표본 설정에서 이론적으로 타당한 회귀 분석 결과 사이의 격차를 메운다.
  • 유한한 수명 주기 MDP에서 낙관주의와 선형 기능 근사를 결합한 증명 가능한 효율적인 탐색 메커니즘을 제공한다.
  • 표본 MDP를 초월해 구조적이고 고차원적인 상태 공간으로 탐색에 대한 톰슨 샘플링 스타일의 이론적 이해를 확장한다.
  • 저랭크 동역학 하에서 특성 차원 $d$, 수명 주기 $H$, 총 단계 수 $T$에 대해 다항수준으로 증가하는 회귀 분석 결과를 확립한다.

제안 방법

  • 최소 제곱 추정치에 대한 편향을 조정하여 일정 확률로 낙관주의를 보장하는 RLSVI의 낙관적으로 초기화된 변종을 제안한다.
  • 특성 공분산 행렬의 역수에 비례하는 분산을 가진 가우시안 편향을 사용하며, 이를 추정 오차를 초월하도록 조정한다.
  • 자기 정규화된 마팅글 농도 부등식(보조정리 11)을 활용하여 추정 오차의 시간에 따른 증가를 통제한다.
  • 커버링 수 이론(보조정리 15)과 특성 노름 경계(보조정리 13)를 적용하여 고차원 매개변수 공간에서의 불확실성을 관리한다.
  • 값 반복 단계 동안의 편향 누적에 대응하는 수정된 신뢰 집합 구성 방법을 도입한다.
  • Sherman-Morrison 공식을 사용하여 각 업데이트에 $O(d^2)$ 시간 내에 역 공분산 행렬을 업데이트함으로써 계산 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1기능 근사를 통한 비표본 설정에서 RLSVI를 통한 랜덤화 탐색이 이론적으로 정당화될 수 있는가?
  • RQ2선형 기능 근사와 낙관적 편향을 사용할 때, 랜덤화된 가치 반복 알고리즘의 빈도주의 회귀 분석 결과는 무엇인가?
  • RQ3저랭크 동역학 하에서 특성 차원 $d$, 수명 주기 $H$, 단계 수 $T$에 따라 회귀 분석 결과는 어떻게 척도화되는가?
  • RQ4편향 전파가 발생함에도 불구하고, 다수의 값 반복 단계 동안 낙관주의 성질을 유지할 수 있는가?
  • RQ5기존 상태 수에 비해 $d$와 $H$에 대해 다항수준으로 증가하는 회귀 분석 결과를 달성할 수 있는가?

주요 결과

  • 제안된 알고리즘은 저랭크 전이 동역학 하에서 $\widetilde{O}(d^2H^2\sqrt{T})$의 빈도주의 회귀 분석 결과를 달성한다.
  • 이 결과는 기능 근사를 통한 랜덤화 탐색에 대해, 초기 유한 수명 주기 MDP에서의 첫 번째 회귀 분석 결과이다.
  • 분석 결과에 따르면, 낙관주의를 보장하기 위해 편향 크기가 추정 오차를 초월해야 하며, 이는 선형 밴드잇 이론과 일치한다.
  • 오차 누적에 대응하기 위해 편향 분산을 정교하게 조정함으로써, 낙관주의 성질이 시간 단계를 넘어 유지된다.
  • 유사한 회귀 분석 결과를 달성하는 옵timistic $Q$-학습 알고리즘과 비교해, 이 결과는 $\sqrt{Hd}$ 배수만큼 열악한 성능을 보이며, 이 격차를 줄일 수 있는지 여부는 여전히 열려있다.
  • 매 에피소드당 $O(d^2AHK^2)$의 실행 시간과 $O(dAHK)$의 메모리 사용량을 유지하며, 랭크-일치 업데이트를 활용해 계산 효율성을 확보한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.