[论文解读] Policy Finetuning: Bridging Sample-Efficient Offline and Online Reinforcement Learning
本文提出策略微调(policy finetuning),这是一种统一的强化学习设定,通过利用接近最优策略 $\pi_{\star}$ 的参考策略 $\mu$,弥合了离线与在线强化学习之间的差距。该工作提出一种混合算法,通过结合 $\mu$ 收集的离线数据与自适应在线探索,实现了更高的样本效率,并首次证明了离线缩减方法的紧致样本复杂度上界为 $\widetilde{O}(H^3 S C^\star / \varepsilon^2)$,同时建立了下界,表明最优性能只能通过纯离线缩减或完全在线方法实现。
Recent theoretical work studies sample-efficient reinforcement learning (RL) extensively in two settings: learning interactively in the environment (online RL), or learning from an offline dataset (offline RL). However, existing algorithms and theories for learning near-optimal policies in these two settings are rather different and disconnected. Towards bridging this gap, this paper initiates the theoretical study of policy finetuning, that is, online RL where the learner has additional access to a "reference policy" $μ$ close to the optimal policy $π_\star$ in a certain sense. We consider the policy finetuning problem in episodic Markov Decision Processes (MDPs) with $S$ states, $A$ actions, and horizon length $H$. We first design a sharp offline reduction algorithm -- which simply executes $μ$ and runs offline policy optimization on the collected dataset -- that finds an $\varepsilon$ near-optimal policy within $\widetilde{O}(H^3SC^\star/\varepsilon^2)$ episodes, where $C^\star$ is the single-policy concentrability coefficient between $μ$ and $π_\star$. This offline result is the first that matches the sample complexity lower bound in this setting, and resolves a recent open question in offline RL. We then establish an $Ω(H^3S\min\{C^\star, A\}/\varepsilon^2)$ sample complexity lower bound for any policy finetuning algorithm, including those that can adaptively explore the environment. This implies that -- perhaps surprisingly -- the optimal policy finetuning algorithm is either offline reduction or a purely online RL algorithm that does not use $μ$. Finally, we design a new hybrid offline/online algorithm for policy finetuning that achieves better sample complexity than both vanilla offline reduction and purely online RL algorithms, in a relaxed setting where $μ$ only satisfies concentrability partially up to a certain time step.
研究动机与目标
- 统一样本高效离线与在线强化学习的理论理解。
- 研究参考策略 $\mu$(其与最优策略 $\pi_{\star}$ 接近)在集中性(concentrability)方面的优势。
- 通过提出一种新设定——策略微调,弥合离线与在线强化学习的差距,允许同时进行数据收集与自适应探索。
- 为策略微调建立紧致的理论样本复杂度边界,包括一个下界,表明离线缩减或纯在线强化学习方法为最优。
- 设计一种混合算法,在参考策略 $\mu$ 仅部分满足集中性条件的宽松设定下,优于标准离线缩减与纯在线强化学习方法。
提出的方法
- 提出策略微调作为一种新型强化学习设定,可访问参考策略 $\mu$ 与交互式环境。
- 设计一种离线缩减算法(PEVI-Adv),利用 $\mu$ 收集数据,并应用离线策略优化以寻找 $\varepsilon$-最优策略。
- 提出一种混合离线/在线算法,利用 $\mu$ 进行数据收集,并通过自适应探索提升样本效率。
- 引入集中性系数($C^\star$ 与 $C^{\rm partial}$)以衡量 $\mu$ 覆盖最优策略状态-动作分布的能力。
- 采用带置信区间与偏差分解的值函数估计方法,分析所提算法的性能。
- 应用归纳法、集中不等式与递归误差界等理论工具,推导样本复杂度保证。
实验结果
研究问题
- RQ1一个与最优策略 $\pi_{\star}$ 接近的参考策略 $\mu$ 是否能显著提升强化学习的样本效率?
- RQ2最优利用 $\mu$ 的方式是什么?应仅用于离线数据收集,还是自适应在线探索能带来更优的样本复杂度?
- RQ3使用参考策略的收益是否存在根本性限制?能否通过紧致的样本复杂度下界捕捉这一限制?
- RQ4在 $\mu$ 仅部分满足集中性条件的设定下,结合离线与在线组件的混合算法是否能优于纯离线缩减与纯在线强化学习?
- RQ5离线缩减方法在策略微调中是否实现了最优样本复杂度?其理论界限是否紧致?
主要发现
- 离线缩减算法 PEVI-Adv 实现了 $\widetilde{O}(H^3 S C^\star / \varepsilon^2)$ 集合次数的样本复杂度,以找到 $\varepsilon$-最优策略,与该设定下的理论下界一致。
- 建立了 $\Omega(H^3 S \min\{C^\star, A\} / \varepsilon^2)$ 的样本复杂度下界,适用于任意策略微调算法,表明最优方法只能是纯离线缩减或完全忽略 $\mu$ 的纯在线算法。
- 在宽松设定下,若参考策略 $\mu$ 在时间步 $h_{\star}$ 之前满足部分集中性 $C^{\rm partial}$,则混合算法的样本复杂度优于纯离线缩减与纯在线方法。
- 混合算法的样本复杂度为 $\widetilde{O}\left(\frac{H^2 h_{\star} S C^{\rm partial} + (H - h_{\star})^3 S A (C^{\rm partial})^2}{\varepsilon^2} + \frac{H^2 h_{\star}^{3.5} S C^{\rm partial}}{\varepsilon} \right)$,当 $h_{\star} \ll H$ 时,优于两种基线方法。
- 分析表明,在所推导的样本复杂度条件下,最终输出策略 $\widehat{\pi}$ 满足 $V_1^\star(s_1) - V_1^{\widehat{\pi}}(s_1) \leq \varepsilon$。
- 本研究通过证明在单策略集中性设定下,使用良好参考策略的离线缩减方法可实现最优样本复杂度,从而解决了离线强化学习中的一个开放问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。