[논문 리뷰] Policy Finetuning: Bridging Sample-Efficient Offline and Online Reinforcement Learning
이 논문은 최적 정책 $\pi_{\star}$ 근처의 기준 정책 $\mu$ 를 활용하여 오프라인 및 온라인 강화학습을 연결하는 통합된 강화학습 설정인 정책 피팅(finetuning)을 제안한다. 오프라인 데이터 수집을 $\mu$ 를 통해 수행하고 적응형 온라인 탐색을 조합함으로써 개선된 샘플 효율성을 달성하는 하이브리드 알고리즘을 제안하며, 오프라인 감소에 대해 $\widetilde{O}(H^3 S C^\star / \varepsilon^2)$ 의 엄밀한 샘플 복잡도 상한을 증명하고, 최적 성능는 순수 오프라인 감소 또는 순수 온라인 방법 중 하나로 달성됨을 보여주는 하한을 수립한다.
Recent theoretical work studies sample-efficient reinforcement learning (RL) extensively in two settings: learning interactively in the environment (online RL), or learning from an offline dataset (offline RL). However, existing algorithms and theories for learning near-optimal policies in these two settings are rather different and disconnected. Towards bridging this gap, this paper initiates the theoretical study of policy finetuning, that is, online RL where the learner has additional access to a "reference policy" $μ$ close to the optimal policy $π_\star$ in a certain sense. We consider the policy finetuning problem in episodic Markov Decision Processes (MDPs) with $S$ states, $A$ actions, and horizon length $H$. We first design a sharp offline reduction algorithm -- which simply executes $μ$ and runs offline policy optimization on the collected dataset -- that finds an $\varepsilon$ near-optimal policy within $\widetilde{O}(H^3SC^\star/\varepsilon^2)$ episodes, where $C^\star$ is the single-policy concentrability coefficient between $μ$ and $π_\star$. This offline result is the first that matches the sample complexity lower bound in this setting, and resolves a recent open question in offline RL. We then establish an $Ω(H^3S\min\{C^\star, A\}/\varepsilon^2)$ sample complexity lower bound for any policy finetuning algorithm, including those that can adaptively explore the environment. This implies that -- perhaps surprisingly -- the optimal policy finetuning algorithm is either offline reduction or a purely online RL algorithm that does not use $μ$. Finally, we design a new hybrid offline/online algorithm for policy finetuning that achieves better sample complexity than both vanilla offline reduction and purely online RL algorithms, in a relaxed setting where $μ$ only satisfies concentrability partially up to a certain time step.
연구 동기 및 목표
- 샘플 효율적인 오프라인 및 온라인 강화학습에 대한 이론적 이해를 통합하기 위해.
- 기준 정책 $\mu$ 가 최적 정책 $\pi_{\star}$ 에 가까울 때 농도성(concentrability) 측면에서 어떤 이점을 제공하는지 연구하기 위해.
- 데이터 수집 및 적응형 탐색을 허용하는 새로운 설정인 정책 피팅을 제안하여 오프라인 및 온라인 RL 간 격차를 해소하기 위해.
- 정책 피팅에 대한 샘플 복잡도에 대한 엄밀한 이론적 상한을 수립하고, 오프라인 감소 또는 순수 온라인 RL이 최적임을 보여주는 하한을 제시하기 위해.
- 기준 정책 $\mu$ 가 농도성 조건을 부분적으로 만족하는 상황에서, 순수 오프라인 감소와 순수 온라인 RL보다 우월한 성능을 보이는 하이브리드 알고리즘을 설계하기 위해.
제안 방법
- 기준 정책 $\mu$ 와 상호작용 가능한 환경에 액세스할 수 있는 새로운 RL 설정인 정책 피팅을 제안한다.
- 기준 정책 $\mu$ 를 사용해 데이터를 수집하고 오프라인 정책 최적화를 적용하여 $\varepsilon$-최적 정책를 찾는 오프라인 감소 알고리즘(PEVI-Adv)을 설계한다.
- 기준 정책 $\mu$ 를 사용한 데이터 수집과 적응형 탐색을 통합하여 샘플 효율성을 향상시키는 하이브리드 오프라인/온라인 알고리즘을 제안한다.
- 기준 정책 $\mu$ 가 최적 정책의 상태-행동 분포를 얼마나 잘 커버하는지 측정하기 위해 농도성 계수($C^\star$ 와 $C^{\rm partial}$)를 사용한다.
- 신뢰구간과 편향 분해를 활용한 가치 함수 추정을 통해 제안된 알고리즘의 성능을 분석한다.
- 귀납법, 농도 불등식, 재귀적 오차 상한과 같은 이론적 도구를 적용하여 샘플 복잡도 보장을 유도한다.
실험 결과
연구 질문
- RQ1최적 정책 $\pi_{\star}$ 에 가까운 기준 정책 $\mu$ 가 강화학습의 샘플 효율성에 상당한 기여를 할 수 있는가?
- RQ2기준 정책 $\mu$ 를 최적화하기 위해 어떤 방식으로 활용해야 하는가? 순수하게 오프라인 데이터 수집을 위해 사용할 것인가, 아니면 적응형 온라인 탐색이 더 낮은 샘플 복잡도를 제공할 수 있는가?
- RQ3기준 정책을 사용하는 데에 기초적인 제한이 존재하는가? 그리고 이는 엄밀한 샘플 복잡도 하한을 통해 포착될 수 있는가?
- RQ4오프라인 및 온라인 구성 요소를 조합한 하이브리드 알고리즘이, $\mu$ 가 농도성 조건을 부분적으로 만족하는 설정에서 순수 오프라인 감소 및 순수 온라인 RL보다 뛰어난 성능을 보일 수 있는가?
- RQ5오프라인 감소 접근법이 정책 피팅에서 최적의 샘플 복잡도를 달성하는가? 그리고 이는 이론적으로 엄밀한가?
주요 결과
- 오프라인 감소 알고리즘 PEVI-Adv 는 $\varepsilon$-최적 정책를 찾기 위해 $\widetilde{O}(H^3 S C^\star / \varepsilon^2)$ 에피소드의 샘플 복잡도를 달성하며, 이는 이 설정에서 이론적 하한과 일치한다.
- 모든 정책 피팅 알고리즘에 대해 $\Omega(H^3 S \min\{C^\star, A\} / \varepsilon^2)$ 의 샘플 복잡도 하한이 수립되었으며, 이는 최적 방법가 순수 오프라인 감소 또는 $\mu$ 를 무시하는 순수 온라인 알고리즘임을 의미한다.
- 기준 정책 $\mu$ 가 시간 단계 $h_{\star}$ 까지 부분 농도성 $C^{\rm partial}$ 을 만족하는 완화된 설정에서, 하이브리드 알고리즘이 순수 오프라인 감소 및 순수 온라인 방법보다 더 낮은 샘플 복잡도를 달성한다.
- 하이브리드 알고리즘의 샘플 복잡도는 $\widetilde{O}\left(\frac{H^2 h_{\star} S C^{\rm partial} + (H - h_{\star})^3 S A (C^{\rm partial})^2}{\varepsilon^2} + \frac{H^2 h_{\star}^{3.5} S C^{\rm partial}}{\varepsilon} \right)$ 이며, $h_{\star} \ll H$ 일 때 두 기준보다 개선된다.
- 분석 결과, 유도된 샘플 복잡도 조건 하에서 최종 출력 정책 $\widehat{\pi}$ 는 $V_1^\star(s_1) - V_1^{\widehat{\pi}}(s_1) \leq \varepsilon$ 를 만족한다.
- 이 결과는 단일 정책 농도성 설정에서 기준 정책이 우수한 오프라인 감소가 최적 샘플 복잡도를 달성함을 보여주며, 오프라인 RL 분야의 열린 질문을 해결한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.