Skip to main content
QUICK REVIEW

[논문 리뷰] Multiple-Step Greedy Policies in Online and Approximate Reinforcement Learning

Yonathan Efroni, Gal Dalal|arXiv (Cornell University)|2018. 05. 21.
Reinforcement Learning in Robotics참고 문헌 15인용 수 7
한 줄 요약

이 논문은 온라인 및 근사 강화학습을 위한 다단계 탐욕 정책—특히 $h$- 및 $k$-탐욕 정책—을 도입하고 분석한다. 소프트 정책 갱신이 다단계 탐욕 정책에서는 1단계 탐욕 설정과 달리 단조적 향상을 보장하지 못함을 밝히며, 생성 모델 또는 근사 정책 연산자 하에서 이론적 수렴 보장을 갖는 알고리즘을 제안하고, 근사 오차와 할인 인자에 따라 성능 한계를 설정한다.

ABSTRACT

Multiple-step lookahead policies have demonstrated high empirical competence in Reinforcement Learning, via the use of Monte Carlo Tree Search or Model Predictive Control. In a recent work \cite{efroni2018beyond}, multiple-step greedy policies and their use in vanilla Policy Iteration algorithms were proposed and analyzed. In this work, we study multiple-step greedy algorithms in more practical setups. We begin by highlighting a counter-intuitive difficulty, arising with soft-policy updates: even in the absence of approximations, and contrary to the 1-step-greedy case, monotonic policy improvement is not guaranteed unless the update stepsize is sufficiently large. Taking particular care about this difficulty, we formulate and analyze online and approximate algorithms that use such a multi-step greedy operator.

연구 동기 및 목표

  • 온라인 및 근사 학습과 같은 실용적 RL 환경에서 다단계 탐욕 정책에 대한 이론적 보장을 부족하게 하는 문제를 해결하기 위해.
  • 핵심 문제를 규명하기 위해: 소프트 업데이트가 다단계 탐욕 정책에 대해 1단계 탐욕 사례와 달리 단조적 정책 향상을 보장하지 못함을 밝히기 위해.
  • 수렴과 성능 한계를 보장하는 $h$- 및 $k$-탐욕 연산자를 사용한 온라인 및 근사 알고리즘을 설계하고 분석하기 위해.
  • 생성 모델과 근사 정책 가정 하에서 근사 오차, 할인 인자, 정책 갱신 메커니즘 측면에서 성능 보장을 수립하기 위해.

제안 방법

  • 값 함수 부트스트랩을 통해 $T^{h-1}v$ 에 대한 1단계 탐욕 정책으로서의 $h$-탐욕 정책을 제안하여 다단계 미리보기 가능성을 제공한다.
  • 수정된 벨만 연산자 $T_\kappa^\pi v = (I - \kappa\gamma P^\pi)^{-1}(r^\pi + (1-\kappa)\gamma P^\pi v)$ 를 통해 $\kappa$-탐욕 정책을 도입하며, 이는 1단계와 $h$-단계 정책 사이를 보간한다.
  • 충분한 단계 크기의 스텝 사이즈가 없을 경우, 근사 없이도 소프트 업데이트에서 다단계 탐욕 정책의 단조적 향상 실패를 분석한다.
  • 생성 모델 또는 근사 정책 액세스가 가능한 조건 하에서, $\kappa$-탐욕 연산자를 사용한 온라인 및 근사 정책 반복 알고리즘을 개발하고, 이론적 수렴 보장을 제공한다.
  • 성능 한계를 유도하기 위해 성분별 상한과 기하급수열을 활용한 오차 전파 분석을 수행하며, $\delta$, $\gamma$, $\kappa$ 를 기반으로 한 성능 한계를 도출한다.
  • 정책 갱신 역학을 모델링하기 위해 연산자 $D_\kappa^{\pi^*}P^{\pi^*}$ 를 사용하고, 행렬 노름과 급수 합 기법을 적용하여 반복 과정에서의 누적 오차를 한정한다.

실험 결과

연구 질문

  • RQ1왜 다단계 탐욕 정책을 사용할 경우 소프트 정책 갱신이 정확한 경우에도 단조적 향상을 보장하지 못하는가?
  • RQ2다단계 탐욕 정책을 사용하는 온라인 및 근사 강화학습 알고리즘이 여전히 수렴성과 성능 보장을 달성할 수 있는가?
  • RQ3근사 오차 $\delta$, 할인 인자 $\gamma$, $\kappa$ 파라미터에 따라 다단계 탐욕 정책의 성능 한계는 어떻게 달라지는가?
  • RQ4근사 설정에서 다단계 탐욕 정책 반복의 수렴에 대해 업데이트 스텝 사이즈가 미치는 영향은 무엇인가?
  • RQ5소프트 업데이트 하에서 $h$- 및 $\kappa$-탐욕 정책은 이론적 안정성과 수렴성 측면에서 어떻게 비교되는가?

주요 결과

  • 논문은 소프트 정책 갱신이 다단계 탐욕 정책을 사용할 경우, 스텝 사이즈가 충분히 크지 않다면 단조적 향상을 보장하지 못함을 증명한다. 이는 1단계 탐욕 정책과의 주요 차이점이다.
  • $\kappa$-탐욕 연산자를 사용할 경우, 값 함수 추정의 누적 오차에 대해 $\frac{1-\kappa\gamma}{1-\gamma} C^{\pi^*}_{\kappa}(\mu,\nu) \delta$ 의 성능 한계를 수립한다.
  • 생성 모델 기반의 온라인 설정에서, 알고리즘은 $\frac{1-\kappa\gamma}{1-\gamma} C^{\pi^*}_{\kappa}(\mu,\nu) \delta + \xi^k \frac{R_{\max}}{1-\gamma}$ 의 한계를 달성하며, 여기서 $\xi < 1$ 이다.
  • 두 번째 한계 형태를 통해 잔여 오차를 $\delta$ 이하로 유지하기 위해 $k^* = \left\lceil \frac{(1-\kappa\gamma)\log(R_{\max}/(\delta(1-\gamma)))}{1-\gamma} \right\rceil$ 로 설정할 수 있다.
  • 논문은 $\kappa$-탐욕 정책가 $\kappa\gamma$-할인된 MDP를 보상 형태 $r^\pi + (1-\kappa)\gamma P^\pi v$ 와 함께 해결하는 것과 동치임을 보여주며, 이는 정당화된 해석을 제공한다.
  • 분석을 통해 $\kappa$-탐욕 정책가 1단계와 $h$-단계 정책 사이를 보간하며, 계산 비용과 사전 예측 깊이 사이의 연속적인 트레이드오프를 제공함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.