[논문 리뷰] Representation Learning for Online and Offline RL in Low-rank MDPs
이 논문은 낮은 질서의 마르코프 결정 과정(MDPs)에서 표현 학습을 위한 새로운 알고리즘인 Rep-UCB를 제안하며, 샘플 효율적인 온라인 및 오프라인 강화 학습을 가능하게 한다. 상위 신뢰도 한계를 표현 학습과 통합함으로써, 이전 연구에 비해 샘플 복잡도를 크게 향상시켰다: $\widetilde{O}(d^4 A^2 / (\epsilon^2 (1-\gamma)^5))$이며, Flambe와 같은 탐색-그러나-결정 접근 방식보다 더 단순하고 더 자료 효율적이다.
This work studies the question of Representation Learning in RL: how can we learn a compact low-dimensional representation such that on top of the representation we can perform RL procedures such as exploration and exploitation, in a sample efficient manner. We focus on the low-rank Markov Decision Processes (MDPs) where the transition dynamics correspond to a low-rank transition matrix. Unlike prior works that assume the representation is known (e.g., linear MDPs), here we need to learn the representation for the low-rank MDP. We study both the online RL and offline RL settings. For the online setting, operating with the same computational oracles used in FLAMBE (Agarwal et.al), the state-of-art algorithm for learning representations in low-rank MDPs, we propose an algorithm REP-UCB Upper Confidence Bound driven Representation learning for RL), which significantly improves the sample complexity from $\widetilde{O}( A^9 d^7 / (ε^{10} (1-γ)^{22}))$ for FLAMBE to $\widetilde{O}( A^2 d^4 / (ε^2 (1-γ)^{5}) )$ with $d$ being the rank of the transition matrix (or dimension of the ground truth representation), $A$ being the number of actions, and $γ$ being the discounted factor. Notably, REP-UCB is simpler than FLAMBE, as it directly balances the interplay between representation learning, exploration, and exploitation, while FLAMBE is an explore-then-commit style approach and has to perform reward-free exploration step-by-step forward in time. For the offline RL setting, we develop an algorithm that leverages pessimism to learn under a partial coverage condition: our algorithm is able to compete against any policy as long as it is covered by the offline distribution.
연구 동기 및 목표
- 전이 역학이 낮은 질서이지만 표현이 알려져 있지 않은 낮은 질서의 MDPs에서 압축된, 저차원의 표현을 학습하는 데 도전한다.
- 통합된 프레임워크를 통해 표현 학습, 탐색, 이용을 직접 균형 잡는 방식으로, 온라인 강화 학습의 샘플 효율성을 향상시킨다.
- 부분 커버리지 조건 하에서 오프라인 강화 학습 알고리즘을 증명 가능하게 효율적으로 개발하여, 데이터 분포에 의해 부분적으로 커버되는 어떤 정책이라도 성능 보장을 받을 수 있도록 한다.
- 이전의 탐색-그러나-결정 방법의 한계를 극복하기 위해 시간 단위 간 데이터 공유를 가능하게 하고 알고리즘 설계를 단순화한다.
제안 방법
- 낮은 질서의 MDPs에 대한 온라인 강화 학습에서 표현 학습, 탐색, 이용을 동시에 최적화하는 Upper Confidence Bound 기반 알고리즘인 Rep-UCB를 제안한다.
- 최근에 학습된 표현에 기반한 신뢰도 보너스를 사용하여 탐색을 이끌어내며, 상태-행동 공간의 충분한 커버리지가 보장되도록 한다.
- Flambe에서 제공하는 계산 오라클(예: 최대 likelihood 추정 및 경험 리스크 최소화)을 활용하여 오라클 효율성을 유지하면서도 샘플 복잡도를 향상시킨다.
- 오프라인 강화 학습에서는 분포 이탈을 다루기 위해 낙관주의를 적용하여, 오프라인 데이터 분포에 의해 부분적으로 커버되는 어떤 정책이라도 경쟁할 수 있도록 보장한다.
- 진짜 표현 $\phi^\star$에만 의존하는 부분 커버리지 조건을 도입하여, 이전 방법보다 더 강력한 일반화 보장을 가능하게 한다.
- 표현 오차 분해 및 유한 샘플 일반화 경계를 사용하여, 오차 경계를 샘플 복잡도로 변환하는 데 Lemma 23을 활용한다.
실험 결과
연구 질문
- RQ1표현이 알려져 있지 않은 낮은 질서의 MDPs에서 온라인 강화 학습의 샘플 복잡도를 탐색-그러나-결정 접근 방식보다 더 낮출 수 있는가?
- RQ2이전 방법보다 표현 학습, 탐색, 이용을 더 효과적으로 균형 잡는 통합 알고리즘을 어떻게 설계할 수 있는가?
- RQ3분포 이탈 상황에서 어떤 정책에 대해서도 성능을 보장하기 위해 오프라인 강화 학습에서 필요한 최소 커버리지 조건은 무엇인가?
- RQ4표현이 사전에 알려져 있지 않은 상황에서도 낮은 질서의 MDPs에서 증명 가능한 효율적 학습을 달성할 수 있는가?
- RQ5제안된 방법의 샘플 복잡도는 질서 $d$, 행동 수 $A$, 할인 요소 $\gamma$에 따라 어떻게 스케일링되는가?
주요 결과
- Rep-UCB는 온라인 강화 학습에서 샘플 복잡도 $\widetilde{O}(d^4 A^2 / (\epsilon^2 (1-\gamma)^5))$를 달성하며, Flambe의 $\widetilde{O}(A^9 d^7 / (\epsilon^{10} (1-\gamma)^{22}))$에 비해 상당한 향상을 이룬다.
- 이 알고리즘은 Flambe보다 더 단순하며, 층별로 탐색-그러나-결정하는 아키텍처를 피하고 시간 단위 간 데이터 공유를 가능하게 하므로, 더 나은 자료 효율성을 제공한다.
- 오프라인 강화 학습에서는 진짜 표현 $\phi^\star$에 기반한 부분 커버리지 조건 하에서, 오프라인 데이터 분포에 의해 부분적으로 커버되는 어떤 정책이라도 경쟁할 수 있다.
- 이 논문에서 사용된 부분 커버리지 조건은 이전 연구(예: Xie 등, 2021)의 것보다 더 약한 조건이며, 보상을 포함한 확장된 특징이 아닌 진짜 표현 $\phi^\star$에만 의존한다.
- 이 알고리즘의 성능 보장은 일부 이전 방법이 마르코프 정책에 국한되는 것과 달리, 역사 의존 정책으로도 확장된다.
- 이론적 분석은 유한 샘플 오차에서 복잡도로의 변환 기법(논문의 Lemma 23)을 새로 도입하여, 일반화 오차의 로그 인자 제어를 통해 더 날카운 샘플 복잡도 경계를 도출한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.