[논문 리뷰] Reward-Free Model-Based Reinforcement Learning with Linear Function Approximation
이 논문은 보상 자유 설정 하에서 에피소드형 선형 혼합 MDP에 대해 모델 기반 강화학습 알고리즘인 UCRL-RFE와 UCRL-RFE+를 제안한다. 탐색 중심의 보상 함수와 가짜 가치 함수를 사용하여 UCRL-RFE는 $Õ(H^5 d^2 \\-2})$의 샘플 복잡도를 달성하며, UCRL-RFE+는 베르누이 타입 보너스를 사용하여 이를 $Õ(H^4 d(H+d) \\-2})$로 향상시켜 $H \geq d$일 때 정보 이론적 하한선과 일치시킨다. 결과적으로 선형 함수 근사와 함께 보상 자유 RL에 대해 날카로운 샘플 복잡도 경계를 확립한다.
We study the model-based reward-free reinforcement learning with linear function approximation for episodic Markov decision processes (MDPs). In this setting, the agent works in two phases. In the exploration phase, the agent interacts with the environment and collects samples without the reward. In the planning phase, the agent is given a specific reward function and uses samples collected from the exploration phase to learn a good policy. We propose a new provably efficient algorithm, called UCRL-RFE under the Linear Mixture MDP assumption, where the transition probability kernel of the MDP can be parameterized by a linear function over certain feature mappings defined on the triplet of state, action, and next state. We show that to obtain an $ε$-optimal policy for arbitrary reward function, UCRL-RFE needs to sample at most $ ilde{\mathcal{O}}(H^5d^2ε^{-2})$ episodes during the exploration phase. Here, $H$ is the length of the episode, $d$ is the dimension of the feature mapping. We also propose a variant of UCRL-RFE using Bernstein-type bonus and show that it needs to sample at most $ ilde{\mathcal{O}}(H^4d(H + d)ε^{-2})$ to achieve an $ε$-optimal policy. By constructing a special class of linear Mixture MDPs, we also prove that for any reward-free algorithm, it needs to sample at least $ ilde Ω(H^2dε^{-2})$ episodes to obtain an $ε$-optimal policy. Our upper bound matches the lower bound in terms of the dependence on $ε$ and the dependence on $d$ if $H \ge d$.
연구 동기 및 목표
- 보상 함수가 반복적으로 변경될 때 전통적 강화학습의 샘플 비효율성을 해결하기 위해 탐색과 보상을 분리하는 보상 자유 프레임워크를 개발한다.
- 특히 선형 혼합 MDP 가정 하에 선형 함수 근사와 함께 보상 자유 설정에서 모델 기반 강화학습의 통계적 효율성을 연구한다.
- 선형 함수 근사와 함께 보상 자유 강화학습의 샘플 복잡도 상한과 하한 사이의 격차를 해소한다.
- 임의의 보상 함수에 대해 근사 최적의 샘플 복잡도를 달성하면서도 증명 가능하게 효율적인 알고리즘을 설계한다.
제안 방법
- 선형 혼합 MDP에서 탐색을 이끄는 새로운 탐색 중심 보상 함수와 가짜 가치 함수를 제안한다.
- 신뢰 구간 기반 보너스를 사용하는 불확실성에 대한 낙관주의 원칙을 적용한 UCRL 스타일의 알고리즘인 UCRL-RFE를 설계한다.
- 과도한 탐색을 줄이고 샘플 효율성을 향상시키기 위해 베르누이 타입 보너스를 사용하는 UCRL-RFE+의 변형을 도입한다.
- 총 분산 분석을 활용하여 추정 오차를 제한하고 더 날카로운 샘플 복잡도 보장을 유도한다.
- 샘플 복잡도에 대한 매칭되는 하한을 증명하기 위해 특수한 선형 혼합 MDP 클래스를 구성한다.
- 판노의 부등식과 KL 발산 분해를 사용하여 보상 자유 강화학습의 정보 이론적 한계를 확립한다.
실험 결과
연구 질문
- RQ1선형 혼합 MDP에서 선형 함수 근사와 함께 보상 자유 모델 기반 강화학습의 최적 샘플 복잡도는 무엇인가?
- RQ2임의의 보상 함수에 대해 근사 최적의 샘플 복잡도를 달성하면서도 증명 가능하게 효율적인 알고리즘을 설계할 수 있는가?
- RQ3표준 신뢰 구간 기반 탐색과 비교할 때 베르누이 타입 보너스 사용이 샘플 효율성에 어떻게 기여하는가?
- RQ4어떤 보상 자유 알고리즘이 $\epsilon$-최적 정책을 달성하기 위해 필요한 에피소드 수에 대한 정보 이론적 하한은 무엇인가?
- RQ5이 설정에서 획득 시간 $H$, 특징 차원 $d$, 정확도 $\epsilon$에 대한 의존성은 샘플 복잡도에 어떻게 영향을 미치는가?
주요 결과
- UCRL-RFE는 임의의 보상 자유 선형 혼합 MDP에서 $\epsilon$-최적 정책을 학습하기 위해 $\widetilde{\mathcal{O}}(H^5 d^2 \epsilon^{-2})$의 샘플 복잡도를 달성한다.
- UCRL-RFE+는 베르누이 타입 보너스를 사용하여 샘플 복잡도를 $\widetilde{\mathcal{O}}(H^4 d(H+d) \epsilon^{-2})$로 감소시켜 UCRL-RFE 대비 $\min\{H,d\}$의 요소로 향상시킨다.
- 매칭되는 하한 $\widetilde{\Omega}(H^2 d \epsilon^{-2})$가 증명되었으며, 이는 $H \geq d$일 때 UCRL-RFE+가 로그 인자 외에는 최적이 됨을 보여준다.
- 제안된 탐색 중심 보상 함수와 가짜 가치 함수는 선형 혼합 MDP에서 높은 불확실성의 상태-행동 쌍으로의 탐색을 효과적으로 이끈다.
- 분석 결과, $H \geq d$일 때 상한에서의 $H$와 $d$에 대한 의존성이 하한과 일치함을 확인하여 핵심 매개변수에서의 날카로운 경계를 확인한다.
- 이 결과는 선형 혼합 MDP 가정 하에 선형 함수 근사와 함께 보상 자유 모델 기반 강화학습에 대해 첫 번째 증명 가능하게 효율적인 알고리즘을 확립한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.