Skip to main content
QUICK REVIEW

[논문 리뷰] Sample-Efficient Reinforcement Learning for Linearly-Parameterized MDPs with a Generative Model

Bingyan Wang, Yuling Yan|PubMed|2021. 05. 28.
Reinforcement Learning in Robotics참고 문헌 65인용 수 6
한 줄 요약

이 논문은 생성 모델을 사용하여 선형으로 매개변수화된 마르코프 결정 과정(MDPs)에 대해 샘플 효율적인 강화 학습 방법을 제안한다. $ K $차원의 상태-행동 특징을 갖는 특징 기반 선형 전이 모델을 활용하여, 모델 기반 강화 학습과 일반 Q-학습이 각각 $ \widetilde{O}(K / (1-\gamma)^3\varepsilon^2) $ 및 $ \widetilde{O}(K / (1-\gamma)^4\varepsilon^2) $의 샘플 복잡도 한계를 확립한다. 이는 증명된 바로가 성능이며, 상태 공간과 행동 공간의 크기와는 무관하다.

ABSTRACT

The curse of dimensionality is a widely known issue in reinforcement learning (RL). In the tabular setting where the state space <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>S</mml:mi></mml:math> and the action space <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>A</mml:mi></mml:math> are both finite, to obtain a nearly optimal policy with sampling access to a generative model, the minimax optimal sample complexity scales linearly with <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mrow><mml:mo>|</mml:mo> <mml:mi>S</mml:mi> <mml:mo>|</mml:mo> <mml:mo>×</mml:mo> <mml:mo>|</mml:mo> <mml:mi>A</mml:mi> <mml:mo>|</mml:mo></mml:mrow> </mml:math> , which can be prohibitively large when <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>S</mml:mi></mml:math> or <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>A</mml:mi></mml:math> is large. This paper considers a Markov decision process (MDP) that admits a set of state-action features, which can linearly express (or approximate) its probability transition kernel. We show that a model-based approach (resp. Q-learning) provably learns an <i>ε</i>-optimal policy (resp. Q-function) with high probability as soon as the sample size exceeds the order of <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"> <mml:mrow><mml:mfrac><mml:mi>K</mml:mi> <mml:mrow> <mml:msup><mml:mrow><mml:mo>(</mml:mo> <mml:mn>1</mml:mn> <mml:mo>-</mml:mo> <mml:mi>γ</mml:mi> <mml:mo>)</mml:mo></mml:mrow> <mml:mn>3</mml:mn></mml:msup> <mml:msup><mml:mi>ε</mml:mi> <mml:mn>2</mml:mn></mml:msup> </mml:mrow> </mml:mfrac> <mml:mrow><mml:mo>(</mml:mo> <mml:mrow><mml:mtext>resp</mml:mtext> <mml:mo>.</mml:mo> <mml:mspace></mml:mspace> <mml:mfrac><mml:mi>K</mml:mi> <mml:mrow> <mml:msup><mml:mrow><mml:mo>(</mml:mo> <mml:mn>1</mml:mn> <mml:mo>-</mml:mo> <mml:mi>γ</mml:mi> <mml:mo>)</mml:mo></mml:mrow> <mml:mn>4</mml:mn></mml:msup> <mml:msup><mml:mi>ε</mml:mi> <mml:mn>2</mml:mn></mml:msup> </mml:mrow> </mml:mfrac> </mml:mrow> <mml:mo>)</mml:mo></mml:mrow> </mml:mrow> </mml:math> , up to some logarithmic factor. Here <i>K</i> is the feature dimension and <i>γ</i> ∈ (0, 1) is the discount factor of the MDP. Both sample complexity bounds are provably tight, and our result for the model-based approach matches the minimax lower bound. Our results show that for arbitrarily large-scale MDP, both the model-based approach and Q-learning are sample-efficient when <i>K</i> is relatively small, and hence the title of this paper.

연구 동기 및 목표

  • 강화 학습에서 차원의 극복 문제를 다루기 위해, 특히 상태 공간과 행동 공간이 크거나 무한한 경우에 유용하게 기여하고자 한다.
  • 생성 모델을 사용하는 선형 전이 모델 하에서 모델 기반 강화 학습과 Q-학습의 샘플 효율성을 연구하고자 한다.
  • 고차원 MDPs에서 $ \varepsilon $-최적 정책과 Q-함수를 학습하는 데 있어 엄밀한 샘플 복잡도 한계를 확립하고자 한다.
  • 선형 전이 가정 하에서 샘플 복잡도가 상태 공간과 행동 공간 크기 $ |\mathcal{S}| \times |\mathcal{A}| $ 가 아니라 특징 차원 $ K $ 에 따라 스케일링됨을 보여주고자 한다.
  • 모델 기반 접근법의 샘플 복잡도에서 최소 최대 최적성과 Q-학습의 근접 최적성 증명을 목적으로 한다.

제안 방법

  • 논문은 전이 커널 $ \mathbb{P}(\cdot|s,a) $ 가 $ K $차원 특징 벡터 $ \phi(s,a) $ 에 의해 선형으로 매개변수화되는 선형 전이 모델을 가정한다. 이때 알려지지 않은 행렬 $ \Psi \in \mathbb{R}^{|Σ| \times K} $ 이 존재한다.
  • 생성 모델을 사용하여 샘플을 수집하고, 모델 기반 계획을 위한 경험 MDP를 구성한다.
  • 모델 기반 강화 학습에서는 경험 MDP에서 값 반복을 수행하여 $ \varepsilon $-최적 정책을 계산한다.
  • Q-학습의 경우는 탐색을 포함한 표준 Q-학습 업데이트를 적용하고, 이가리기 기법을 사용한 수렴 분석을 수행한다.
  • 선형 모델의 추정 오차를 제어하고 정책 및 Q-함수 정확도에 대한 고확률 한계를 유도하기 위해 이가리기 분석 기법을 사용한다.
  • 샘플 복잡도가 모델 기반 강화 학습에 대해 $ \widetilde{O}(K / (1-\gamma)^3\varepsilon^2) $, Q-학습에 대해 $ \widetilde{O}(K / (1-\gamma)^4\varepsilon^2) $ 로 스케일링됨을 증명하며, 이는 로그 인자 외에는 최소 최대 하한선과 일치한다.

실험 결과

연구 질문

  • RQ1생성 모델 하에서 선형으로 매개변수화된 MDPs에 대해 모델 기반 강화 학습의 샘플 복잡도는 무엇인가?
  • RQ2Q-학습은 이 설정에서 샘플 효율성을 달성할 수 있으며, 이는 최소 최대 하한선과 비교해 어떤가?
  • RQ3샘플 복잡도는 상태 공간과 행동 공간 크기에 따라 의존하는가, 아니면 특징 차원 $ K $ 에만 의존하는가?
  • RQ4선형 전이 모델의 구조는 크거나 무한한 MDPs의 효과적 복잡도를 어떻게 감소시키는가?
  • RQ5제안된 모델 기반 접근법은 샘플 복잡도 측면에서 최소 최대 최적인가?

주요 결과

  • 모델 기반 강화 학습 접근법은 높은 확률로 $ \widetilde{O}(K / (1-\gamma)^3\varepsilon^2) $개의 샘플을 사용하여 $ \varepsilon $-최적 정책을 달성하며, 이는 로그 인자 외에는 최소 최대 하한선과 일치한다.
  • Q-학습은 $ \widetilde{O}(K / (1-\gamma)^4\varepsilon^2) $개의 샘플을 사용하여 엔트리별로 $ \varepsilon $-최적 Q-함수를 증명적으로 학습하며, 이는 이전 결과를 향상시킨다.
  • 샘플 복잡도는 $ |\mathcal{S}| $ 와 $ |\mathcal{A}| $ 의 크기와는 무관하며, 오직 특징 차원 $ K $ 에 따라 스케일링되므로, 대규모 MDPs에서 샘플 효율성을 보장한다.
  • 모델 기반 방법은 최소 최대 최적이며, Q-학습의 샘플 복잡도는 $ (1-\gamma)^{-4} $ 의 의존성으로 인해 기존 하한선에 의해 정확히 날카로운 것으로 확인된다.
  • 결과는 생성 모델 하에 성립하며, $ K $차원 특징을 갖는 선형 전이 모델을 가정한다. 이는 표본 및 동질 MDPs를 일반화한다.
  • 분석은 선형 모델의 추정 오차를 제어하기 위해 새로운 이가리기 기법을 사용하며, 이는 정책 및 Q-함수 정확도에 대한 엄밀한 고확률 한계를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.