[논문 리뷰] On the Sample Complexity of Reinforcement Learning with Policy Space Generalization
이 논문은 정 politicy 공간의 내재적 복잡도를 특징짓기 위해 새로운 eluder 차원 개념을 도입하며, 정 politicy 공간 일반화를 통한 강화학습의 내재적 복잡도를 기술한다. 이는 eluder 차원에 선형적으로 의존하는 근사 최적의 샘플 복잡도를 달성하는 스택 기반 탐색 알고리즘을 제안한다. 시뮬레이터가 있는 조건에서는 $\tilde{O}(H\mathrm{dim}_E(\Theta)(\Delta^{-2} + \varepsilon^{-1}))$의 복잡도를, 결정성 시스템에서는 $O(H\bar{R}\cdot\mathrm{dim}_E(\Theta))$의 정규화 오차를 보인다.
We study the optimal sample complexity in large-scale Reinforcement Learning (RL) problems with policy space generalization, i.e. the agent has a prior knowledge that the optimal policy lies in a known policy space. Existing results show that without a generalization model, the sample complexity of an RL algorithm will inevitably depend on the cardinalities of state space and action space, which are intractably large in many practical problems. To avoid such undesirable dependence on the state and action space sizes, this paper proposes a new notion of eluder dimension for the policy space, which characterizes the intrinsic complexity of policy learning in an arbitrary Markov Decision Process (MDP). Using a simulator oracle, we prove a near-optimal sample complexity upper bound that only depends linearly on the eluder dimension. We further prove a similar regret bound in deterministic systems without the simulator.
연구 동기 및 목표
- 거대한 상태 공간과 행동 공간으로 인해 발생하는 높은 샘플 복잡도 문제를 해결한다.
- 최적 정 politicy가 알려진 정 politicy 클래스에 존재할 경우 정 politicy 학습의 내재적 복잡도를 기술하는 이론적 프레임워크를 개발한다.
- 시간 경과에 따라 지수적 의존도를 피하는 샘플 효율적인 탐색 전략을 정 politicy 학습에 대해 설계한다.
- 정 politicy 공간에 대한 새로운 복잡도 측정 기준을 사용하여 샘플 복잡도와 정규화 오차의 날카운 상한 및 하한을 확립한다.
제안 방법
- 마르코프 결정 과정에서 정 politicy 클래스에 맞춘 새로운 eluder 차원 개념인 $\mathrm{dim}_E(\Theta)$를 제안한다.
- 독립적인 상태-행동 쌍을 추적하여 효율적인 탐색을 이끄는 스택 기반 탐색 알고리즘을 도입한다.
- 최적 $Q$-함수의 $\Delta$-분리가 있는 일반적인 MDP에서 효율적인 정 politicy 평가 및 탐색을 가능하게 하는 시뮬레이터 오라클을 활용한다.
- eluder 차원을 사용하여 독립적인 탐색 단계의 수를 제한함으로써, 상태 공간 크기와는 무관하게 복잡도에 선형 의존성을 확보한다.
- 스택의 재귀적 연산과 상태-행동 쌍의 수열에 대한 독립성 논증을 사용하여 정규화 오차와 샘플 복잡도의 상한을 증명한다.
- 정책 공간의 Littlestone 차원에 기반한 최소 최악의 하한을 확립하여 상한의 날카로움을 입증한다.
실험 결과
연구 질문
- RQ1정책 공간의 내재적 복잡도 측정 기준이 정 politicy 공간 일반화를 통한 강화학습의 샘플 복잡도를 기술할 수 있는가?
- RQ2최적 정 politicy가 알려진, 구조화된 정 politicy 클래스에 존재할 경우, 대규모 MDP에서 탐색을 어떻게 샘플 효율적으로 수행할 수 있는가?
- RQ3샘플 복잡도와 정규화 오차가 상태 공간 및 행동 공간 크기와 무관하게 정 politicy 공간의 복잡도에 어떻게 의존하는가?
- RQ4밴딧과 가치 함수 학습에서의 eluder 차원 개념을 MDP에서의 정 politicy 학습으로 일반화할 수 있는가?
- RQ5정책 공간 일반화를 통한 정 politicy 학습에 대한 최소 최악의 하한은 무엇이며, 기존의 조합적 복잡도 측정 기준과 어떻게 관련이 있는가?
주요 결과
- 시뮬레이터가 있는 일반적인 MDP에서 $\varepsilon$-최적 정 politicy를 찾는 샘플 복잡도는 $\tilde{O}(H\mathrm{dim}_E(\Theta)(\Delta^{-2} + \varepsilon^{-1}))$ 이하로 상한이 설정되며, eluder 차원에 선형적으로 의존한다.
- 결정성 시스템에서는 제안된 알고리즘이 $O(H\bar{R}\cdot\mathrm{dim}_E(\Theta))$의 정규화 오차를 달성하며, 시간 경과과 상태 공간 크기와는 무관하다.
- 최소 최악의 정규화 오차는 정 politicy 공간의 Littlestone 차원에 비례하는 양으로 하한이 설정되어, 기본적인 한계를 입증한다.
- 정책 공간의 eluder 차원이 샘플 복잡도를 결정하는 핵심 요소임을 입증하였으며, 상태 공간 또는 행동 공간의 기수와는 무관하다.
- 스택 기반 탐색 메커니즘은 비최적 정 politicy 업데이트의 수가 $O((H+1)\mathrm{dim}_E(\Theta))$ 이하로 제한됨을 보장하여 효율적인 학습을 가능하게 한다.
- 이 연구는 시간 경과 또는 상태 공간 크기와는 무관하게 정 politicy 공간의 내재적 복잡도 측정 기준에만 의존하는 최초의 모델-프리 샘플 복잡도 상한을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.