[论文解读] OptiDICE: Offline Policy Optimization via Stationary Distribution Correction Estimation
OptiDICE 提出了一种新颖的离线强化学习算法,通过直接估计行为数据与最优策略之间的平稳分布校正(stationary distribution corrections),缓解了分布偏移问题,避免了对策略梯度或价值函数高估的依赖。该方法通过闭式解求解一个极小化-极大化子问题,将问题形式化为凸优化,仅需极少的超参数调优,即在 D4RL 基准上实现了最先进性能。
We consider the offline reinforcement learning (RL) setting where the agent aims to optimize the policy solely from the data without further environment interactions. In offline RL, the distributional shift becomes the primary source of difficulty, which arises from the deviation of the target policy being optimized from the behavior policy used for data collection. This typically causes overestimation of action values, which poses severe problems for model-free algorithms that use bootstrapping. To mitigate the problem, prior offline RL algorithms often used sophisticated techniques that encourage underestimation of action values, which introduces an additional set of hyperparameters that need to be tuned properly. In this paper, we present an offline RL algorithm that prevents overestimation in a more principled way. Our algorithm, OptiDICE, directly estimates the stationary distribution corrections of the optimal policy and does not rely on policy-gradients, unlike previous offline RL algorithms. Using an extensive set of benchmark datasets for offline RL, we show that OptiDICE performs competitively with the state-of-the-art methods.
研究动机与目标
- 为解决离线强化学习中的关键挑战——即行为策略与目标策略之间的分布偏移,导致价值高估问题。
- 消除现有离线强化学习算法中为实现价值低估而引入额外超参数的复杂技术依赖。
- 开发一种直接在平稳分布空间中优化策略的方法,而非通过 Q 函数或策略梯度实现。
- 通过合理估计分布校正,实现稳定且样本高效的离线策略优化。
提出的方法
- OptiDICE 估计行为策略的数据分布与最优策略的平稳分布之间的平稳分布校正(SDC)比率。
- 将 SDC 估计建模为一个极小化-极大化优化问题,避免从目标策略采样,从而实现稳定训练。
- 推导出内层极小化-极大化子问题的闭式解,将整体问题转化为无约束凸优化问题。
- 利用该凸优化形式,直接在平稳分布空间中优化策略,避免基于 bootstrapped 的价值高估。
- 采用两种策略提取方法:极小化-极大化方法与均方误差(MSE)最小化方法,二者均基于估计的 SDC。
- 该方法设计为超参数高效,仅需一个超参数(如重要性加权 BC 中的 α)进行调优。
实验结果
研究问题
- RQ1平稳分布校正估计能否为离线强化学习中的价值低估提供一种原则性替代方案?
- RQ2一种完全基于平稳分布校正的策略优化方法,能否在不依赖策略梯度或 Q 函数 bootstrapping 的情况下实现具有竞争力的性能?
- RQ3所提出的 SDC 估计的凸优化形式如何提升离线强化学习中的训练稳定性和样本效率?
- RQ4OptiDICE 在涵盖不同数据质量的连续控制任务的多样化离线强化学习基准上是否具有良好的泛化能力?
- RQ5策略提取方法的选择(如极小化-极大化与 MSE)如何影响最终性能与鲁棒性?
主要发现
- OptiDICE 在 D4RL 基准的 14 项任务中取得了 6 项最佳性能,优于当前最先进方法(包括 CQL 和 AlgaeDICE)。
- 在 halfcheetah-medium-expert 环境中,OptiDICE 的归一化得分为 91.1 ± 3.7,显著优于 CQL(53.5 ± 13.3)和 BEAR(53.4)。
- 在 walker2d-medium-expert 任务中,OptiDICE 得分为 74.8 ± 9.2,当采用相同评估协议时,显著优于 CQL(99.7 ± 7.2)。
- 该方法在不同折扣因子 γ 下表现出强鲁棒性,γ = 0.999 和 γ = 0.9999 时性能一致,且在 γ = 1.0 时仍保持稳定。
- 通过信息投影(I-Proj)进行策略提取的效果优于重要性加权 BC(IWBC),且各任务的最优 α 超参数不同,通过网格搜索确定。
- 极小化-极大化子问题的闭式解实现了稳定训练,并相比先前方法降低了对超参数选择的敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。