[论文解读] When Data Geometry Meets Deep Function: Generalizing Offline Reinforcement Learning
本文提出 DOGE,一种新颖的离线强化学习方法,通过状态相关的距离函数利用数据集几何结构,提升对数据分布之外区域的泛化能力。通过基于训练数据几何邻近度约束策略,DOGE 实现了使用深度 Q 函数的安全外推,在 D4RL 基准测试中达到最先进性能,同时相比先前方法减少了过度保守性。
In offline reinforcement learning (RL), one detrimental issue to policy learning is the error accumulation of deep Q function in out-of-distribution (OOD) areas. Unfortunately, existing offline RL methods are often over-conservative, inevitably hurting generalization performance outside data distribution. In our study, one interesting observation is that deep Q functions approximate well inside the convex hull of training data. Inspired by this, we propose a new method, DOGE (Distance-sensitive Offline RL with better GEneralization). DOGE marries dataset geometry with deep function approximators in offline RL, and enables exploitation in generalizable OOD areas rather than strictly constraining policy within data distribution. Specifically, DOGE trains a state-conditioned distance function that can be readily plugged into standard actor-critic methods as a policy constraint. Simple yet elegant, our algorithm enjoys better generalization compared to state-of-the-art methods on D4RL benchmarks. Theoretical analysis demonstrates the superiority of our approach to existing methods that are solely based on data distribution or support constraints.
研究动机与目标
- 解决现有离线强化学习方法过度保守的问题,这些方法将策略限制在数据分布内,损害泛化能力。
- 探究当策略受数据集几何结构引导时,深度 Q 函数是否能在分布外(OOD)区域实现有效泛化。
- 开发一种方法,利用深度网络的插值能力,同时避免在 OOD 区域进行不可靠的外推。
- 设计一种即插即用的约束机制,将几何归纳偏置整合到标准演员-评论家框架中。
- 在无需在线交互或复杂架构修改的前提下,展示在 D4RL 基准测试中提升泛化性能。
提出的方法
- 提出一种状态相关的距离函数,用于度量状态-动作对与训练数据集凸包的几何接近程度。
- 将该距离函数作为可学习、可微分的约束,应用于演员-评论家框架中,以正则化策略更新。
- 引入超参数 $ G $,表示小批量中距离的上分位数,以控制分布外探索的范围。
- 制定一个约束优化目标,基于学习到的距离,对远离训练数据的动作施加惩罚。
- 使用拉格朗日松弛方案,端到端联合训练距离函数与主强化学习组件,以平衡约束执行与策略优化。
- 将该方法应用于标准离线强化学习算法(如 SAC),仅做最小的架构修改,实现即插即用的集成。
实验结果
研究问题
- RQ1当策略受训练数据几何接近度引导时,深度 Q 函数是否能在分布外区域实现可靠泛化?
- RQ2在策略约束中引入数据集几何结构是否能在不牺牲样本效率或安全性的情况下提升离线强化学习的泛化能力?
- RQ3通过 $ G $ 选择的距离阈值如何影响保守性与分布外泛化性能之间的权衡?
- RQ4一种简单、几何感知的约束是否能优于仅依赖数据分布或支持约束的现有方法?
- RQ5所提方法在 $ G $、$ eta $ 和 $ N $ 的超参数变化下,其鲁棒性如何?
主要发现
- DOGE 在 D4RL 基准测试中达到最先进性能,在多个 MuJoCo 和 AntMaze 环境中优于 SAC、TD3 和 CQL 等 SOTA 方法。
- 该方法显著减少了过度保守性:例如,在 hopper-m-r-v2 环境中,DOGE 使用 $ G=50\text{th} $ 分位数时达到 76.2±17.7,优于更保守的基线方法。
- 消融研究显示,$ G=50\text{th} $ 分位数提供稳健的默认设置,在多样化任务中平衡了探索与安全性。
- 使用 $ G=30\text{th} $ 分位数会导致约束过度强化,引发 $ \theta \to \theta_{\text{old}} $,并因次优性差距主导而导致性能下降。
- 使用 $ G=90\text{th} $ 或 $ 100\text{th} $ 分位数会增加值函数过估计与方差风险,导致在高方差任务(如 hopper-m-r-v2 和 walker2d-m-r-v2)中性能下降。
- 该方法对 $ \beta $ 和 $ N $ 的变化具有鲁棒性,性能影响微小,表明具有强超参数稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。