Skip to main content
QUICK REVIEW

[논문 리뷰] Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL

Weitong Zhang, Jiafan He|arXiv (Cornell University)|2021. 06. 22.
Advanced Bandit Algorithms Research참고 문헌 41인용 수 4
한 줄 요약

이 논문은 저질서 Markov 결정 과정에서 표현 선택을 위한 증명 가능하게 효율적인 알고리즘인 ReLEX를 제안한다. 이는 온라인 및 오프라인 강화 학습에서 다수의 표현을 적응적으로 사용할 수 있도록 한다. 커버리지 가정 하에 온라인 RL에서 개선된 리그레트 경계와 오프라인 RL에서 일정한 샘플 복잡도를 달성하며, 단일 표현 방법보다 뛰어나다.

ABSTRACT

The success of deep reinforcement learning (DRL) lies in its ability to learn a representation that is well-suited for the exploration and exploitation task. To understand how the choice of representation can improve the efficiency of reinforcement learning (RL), we study representation selection for a class of low-rank Markov Decision Processes (MDPs) where the transition kernel can be represented in a bilinear form. We propose an efficient algorithm, called ReLEX, for representation learning in both online and offline RL. Specifically, we show that the online version of ReLEX, called ReLEX-UCB, always performs no worse than the state-of-the-art algorithm without representation selection, and achieves a strictly better constant regret if the representation function class has a "coverage" property over the entire state-action space. For the offline counterpart, ReLEX-LCB, we show that the algorithm can find the optimal policy if the representation class can cover the state-action space and achieves gap-dependent sample complexity. This is the first result with constant sample complexity for representation learning in offline RL.

연구 동기 및 목표

  • 다양한 상태-행동 쌍에서 최적의 표현을 선택하는 데 도전하는 데, 특히 다수의 표현이 존재할 경우를 고려한다.
  • 각 상태-행동 쌍에 대해 가장 좋은 표현을 동적으로 선택하여 온라인 및 오프라인 RL의 샘플 효율성을 향상시키는 것.
  • 특히 이차 전이 커널 하에서, 저질서 MDP에서의 표현 선택에 대한 이론적 보장을 수립하는 것.
  • 표현 선택을 통한 오프라인 RL 표현 학습의 격차를 메우기 위해, 커버리지 가정 하에 첫 번째로 일정한 샘플 복잡도 결과를 제공하는 것.
  • 경험적으로 표현 선택이 고정된 표현에 비해 성능 향상에 크게 기여함을 보여주는 것.

제안 방법

  • ReLEX는 온라인 RL에서 옵timistic Q-값을 최소화하는 표현을 선택하는 표현 선택 메커니즘을 사용한다 (ReLEX-UCB), 오프라인 RL에서는 Pessimistic Q-값을 최대화한다 (ReLEX-LCB).
  • 전이 커널을 $ \mathbb{P}(s'\mid s,a) = \bm{\phi}(s,a)^\top \mathbf{M}^* \bm{\psi}(s') $ 의 이차형식으로 모델링하여 저질서 구조를 효과적으로 활용한다.
  • 온라인 RL에서는 ReLEX-UCB가 탐색과 표현 선택을 균형 잡기 위해 상한 신뢰도를 사용하며, 표현 클래스가 상태-행동 공간을 잘 커버할 경우 리그레트 경계가 향상된다.
  • 오프라인 RL에서는 ReLEX-LCB가 분포 이탈을 다루기 위해 낙관주의를 적용하고, 커버리지 가정 하에 최적 정책을 식별한다.
  • 표현 추정의 불확실성을 제어하기 위해 행렬 농도와 자기 정규화된 마틴갈 부등식을 활용한다.
  • 표현 선택 오차를 제한하고 갭-의존적 및 일정한 샘플 복잡도 결과를 도출하기 위한 새로운 분석 프레임워크를 도입한다.

실험 결과

연구 질문

  • RQ1상태-행동 쌍 간의 동적 표현 선택이 온라인 및 오프라인 강화 학습에서 샘플 효율성을 향상시킬 수 있는가?
  • RQ2표현 선택이 온라인 RL에서 고정된 표현 방법보다 엄밀히 더 낫게 리그레트 경계를 개선하는가?
  • RQ3커버리지 가정 하에 표현 선택을 사용할 경우 오프라인 RL 알고리즘이 일정한 샘플 복잡도를 달성할 수 있는가?
  • RQ4표현 커버리지가 저질서 MDP에서 강화 학습 알고리즘의 성능 및 일반화에 어떤 영향을 미치는가?
  • RQ5제안된 알고리즘 ReLEX는 온라인 및 오프라인 설정 모두에서 단일 표현 기반 방법보다 뛰어나게 성능을 발휘할 수 있는가?

주요 결과

  • ReLEX-UCB는 표현 선택이 없는 최신 기술보다 리그레트 경계가 악화되지 않으며, 표현 클래스가 상태-행동 공간을 완전히 커버할 경우 엄밀히 더 낫다.
  • ReLEX-LCB는 갭-의존적 샘플 복잡도로 최적 정책을 식별하며, 행동 정책에 대한 커버리지 가정 하에 일정한 샘플 복잡도를 달성한다.
  • 오프라인 RL에서의 일정한 샘플 복잡도는 표현 학습 분야에서 첫 번째 결과로, 이론적 진전을 상징한다.
  • 경험적 평가 결과, ReLEX는 다양한 MDP에서 온라인 및 오프라인 설정 모두에서 어떤 단일 표현보다 뛰어난 성능을 보였다.
  • 표현 클래스에 최적 정책의 상태-행동 분포를 커버하는 함수가 포함되어 있을 경우, 알고리즘의 성능 향상이 가장 두드러졌다.
  • 이론적 분석은 표현 선택 메커니즘이 불확실성을 효과적으로 감소시켜 더 날카로운 일반화 경계를 이끌어낸다는 것을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.