[论文解读] Settling the Sample Complexity of Model-Based Offline Reinforcement Learning
该论文证明了在无预热成本的前提下,基于模型的离线强化学习在表格型MDP中实现了最小最大最优样本复杂度,采用带有Bernstein风格惩罚项的悲观值迭代算法。其在无限时域MDP中的样本复杂度为 $\frac{SC^\star_{\text{clipped}}}{(1-\gamma)^3\varepsilon^2}$,在有限时域MDP中的样本复杂度为 $\frac{H^4SC^\star_{\text{clipped}}}{\varepsilon^2}$,与最小最大下界相比仅相差对数因子。
This paper is concerned with offline reinforcement learning (RL), which learns using pre-collected data without further exploration. Effective offline RL would be able to accommodate distribution shift and limited data coverage. However, prior algorithms or analyses either suffer from suboptimal sample complexities or incur high burn-in cost to reach sample optimality, thus posing an impediment to efficient offline RL in sample-starved applications. We demonstrate that the model-based (or "plug-in") approach achieves minimax-optimal sample complexity without burn-in cost for tabular Markov decision processes (MDPs). Concretely, consider a finite-horizon (resp. $γ$-discounted infinite-horizon) MDP with $S$ states and horizon $H$ (resp. effective horizon $\frac{1}{1-γ}$), and suppose the distribution shift of data is reflected by some single-policy clipped concentrability coefficient $C^{\star}_{ ext{clipped}}$. We prove that model-based offline RL yields $\varepsilon$-accuracy with a sample complexity of \[ \begin{cases} \frac{H^{4}SC_{ ext{clipped}}^{\star}}{\varepsilon^{2}} & ( ext{finite-horizon MDPs}) \frac{SC_{ ext{clipped}}^{\star}}{(1-γ)^{3}\varepsilon^{2}} & ( ext{infinite-horizon MDPs}) \end{cases} \] up to log factor, which is minimax optimal for the entire $\varepsilon$-range. The proposed algorithms are "pessimistic" variants of value iteration with Bernstein-style penalties, and do not require sophisticated variance reduction. Our analysis framework is established upon delicate leave-one-out decoupling arguments in conjunction with careful self-bounding techniques tailored to MDPs.
研究动机与目标
- 解决离线强化学习中分布偏移与数据覆盖有限的挑战,其中不允许进一步与环境交互。
- 克服先前基于模型的离线强化学习方法中样本复杂度次优及高预热成本的问题。
- 在无限时域与有限时域的表格型MDP中,建立离线强化学习样本复杂度的最小最大最优性。
- 证明一种简单的悲观模型基算法可在无需方差缩减或复杂正则化的情况下实现最优性能。
- 提出一种基于留一法解耦与自绑定技术的新型分析框架,专为MDP设计。
提出的方法
- 提出VI-LCB算法,一种带有Bernstein风格惩罚项的悲观值迭代算法,用于处理模型估计中的不确定性。
- 引入裁剪可浓缩性系数 $C^\star_{\text{clipped}}$,以量化行为策略与目标策略之间的分布偏移。
- 使用留一法解耦技术,处理基于模型规划中值函数估计的统计依赖性。
- 应用自绑定技术,控制使用离线数据进行迭代值迭代时的误差传播。
- 采用两重子采样方法,将辅助数据集与主数据集解耦,解决分析中的统计依赖性问题。
- 通过一种精细化的集中性论证建立理论保证,该论证考虑了混合时间 $t_{\text{mix}}$ 与状态-动作对的覆盖度。

实验结果
研究问题
- RQ1基于模型的离线强化学习能否在无预热或探索需求的前提下,在表格型MDP中实现最小最大最优样本复杂度?
- RQ2在分布偏移下,离线强化学习的最紧可能样本复杂度是多少,其度量标准为裁剪可浓缩性系数?
- RQ3一种简单的悲观值迭代算法能否在无需方差缩减或复杂正则化的情况下匹配最小最大下界?
- RQ4在基于模型的强化学习算法分析中,如何严格处理离线数据中的统计依赖性?
- RQ5混合时间 $t_{\text{mix}}$ 在马尔可夫数据的离线强化学习样本复杂度中起什么作用?
主要发现
- 所提出的VI-LCB算法在无限时域MDP中,以样本复杂度 $\frac{SC^\star_{\text{clipped}}}{(1-\gamma)^3\varepsilon^2}$ 实现 $\varepsilon$-精度,与最小最大下界相比仅相差对数因子。
- 对于有限时域MDP,样本复杂度为 $\frac{H^4SC^\star_{\text{clipped}}}{\varepsilon^2}$,其为最小最大最优,仅相差对数因子。
- 该算法实现了最优性能而无需预热成本,这与先前方法需大量数据以实现稳定形成鲜明对比。
- 分析表明,对混合时间 $t_{\text{mix}}$ 的依赖较弱,其在误差界中体现为项 $\frac{t_{\text{mix}}SC^\star_{\text{clipped}}}{(1-\gamma)^2T}$。
- 该方法对分布偏移具有鲁棒性,其由 $C^\star_{\text{clipped}}$ 系数捕捉,该系数量化了目标策略与行为策略密度之比。
- 通过新颖的留一法解耦论证与自绑定技术建立了理论保证,避免了对复杂方差缩减技术的需求。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。