[论文解读] Pessimistic Model-based Offline Reinforcement Learning under Partial Coverage
本文提出约束性悲观策略优化(CPPO),一种基于模型的离线强化学习算法,通过约束实现悲观性,在离线数据部分覆盖条件下实现近似最优性能。当真实模型属于一般函数类且比较策略被离线数据分布覆盖时,该算法提供多项式样本复杂度保证。
We study model-based offline Reinforcement Learning with general function approximation without a full coverage assumption on the offline data distribution. We present an algorithm named Constrained Pessimistic Policy Optimization (CPPO)which leverages a general function class and uses a constraint over the model class to encode pessimism. Under the assumption that the ground truth model belongs to our function class (i.e., realizability in the function class), CPPO has a PAC guarantee with offline data only providing partial coverage, i.e., it can learn a policy that competes against any policy that is covered by the offline data. We then demonstrate that this algorithmic framework can be applied to many specialized Markov Decision Processes where additional structural assumptions can further refine the concept of partial coverage. Two notable examples are: (1) low-rank MDP with representation learning where the partial coverage condition is defined using a relative condition number measured by the unknown ground truth feature representation; (2) factored MDP where the partial coverage condition is defined using density ratio based concentrability coefficients associated with individual factors.
研究动机与目标
- 解决离线强化学习中全数据覆盖的局限性,该局限性限制了在非探索性行为策略的真实世界场景中的适用性。
- 放宽先前离线强化学习方法中强贝尔曼完备性和全覆盖假设,以允许从部分覆盖的数据集中学习。
- 开发一种通用算法框架,可与任何被离线数据分布覆盖的策略竞争,即使该策略是非马尔可夫性或依赖历史的。
- 将框架扩展至贝叶斯离线强化学习,通过后验抽样消除对显式悲观性或奖励惩罚的需求。
- 在部分覆盖和模型可实现性条件下,提供具有多项式样本复杂度的理论保证。
提出的方法
- 提出 CPPO,一种通过约束策略更新以避免低数据覆盖动作的约束优化框架,从而实现悲观性。
- 对模型使用一般函数类,并施加约束以惩罚在离线数据分布中密度较低的动作。
- 利用特征表示的相对条件数来定义表示学习中低秩 MDP 的部分覆盖。
- 提出一种基于后验抽样的算法 PS-PO,用于贝叶斯离线强化学习,通过迭代从后验中抽样模型并执行增量策略优化。
- 使用函数伯恩斯坦不等式和分布偏移引理建立理论边界,以控制部分覆盖下的泛化误差。
- 利用矩阵集中不等式和 SVD 分解分析比较策略与行为策略之间状态-动作分布偏移的比值。
实验结果
研究问题
- RQ1在部分覆盖条件下,我们能否学习到一个可与任何被离线数据分布覆盖的策略竞争的策略,而无需全数据覆盖?
- RQ2在基于模型的离线强化学习中,如何通过约束而非显式奖励调整来有效编码悲观性?
- RQ3该算法框架能否扩展至贝叶斯离线强化学习,以避免显式构建悲观性?
- RQ4当真实模型属于一般函数类且可实现时,部分覆盖下的学习样本复杂度是多少?
- RQ5如低秩 MDP 等结构假设如何细化部分覆盖的概念并改善泛化性能?
主要发现
- 在模型可实现性和部分覆盖条件下,CPPO 实现了学习与任何被离线数据覆盖的比较策略竞争的策略的多项式样本复杂度。
- 在贝叶斯设置中,该算法在先验分布下保证了期望近似最优性能,无需显式悲观性或奖励惩罚。
- 对于低秩 MDP,部分覆盖通过未知真实特征表示的相对条件数形式化,从而实现更紧的泛化边界。
- 理论分析表明,比较策略与行为策略之间分布偏移的比值受特征表示条件数的有界性约束,从而确保稳定性。
- 在 PS-PO 中使用后验抽样避免了显式悲观性,简化了超越线性模型的算法设计。
- 函数伯恩斯坦不等式和分布偏移引理被用于控制泛化误差,确保在部分覆盖下的收敛性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。