[论文解读] Offline RL Without Off-Policy Evaluation
本文提出了一种使用行为策略的在线策略Q估计的一步策略改进算法,该算法在大多数D4RL基准测试中优于迭代的离线策略演员-critic方法。该方法完全避免了离线策略评估,降低了方差和误差传播,相较于以往的迭代方法,以更高的鲁棒性和简洁性实现了最先进性能。
Most prior approaches to offline reinforcement learning (RL) have taken an iterative actor-critic approach involving off-policy evaluation. In this paper we show that simply doing one step of constrained/regularized policy improvement using an on-policy Q estimate of the behavior policy performs surprisingly well. This one-step algorithm beats the previously reported results of iterative algorithms on a large portion of the D4RL benchmark. The one-step baseline achieves this strong performance while being notably simpler and more robust to hyperparameters than previously proposed iterative algorithms. We argue that the relatively poor performance of iterative approaches is a result of the high variance inherent in doing off-policy evaluation and magnified by the repeated optimization of policies against those estimates. In addition, we hypothesize that the strong performance of the one-step algorithm is due to a combination of favorable structure in the environment and behavior policy.
研究动机与目标
- 挑战离线强化学习中主导的迭代演员-critic算法范式,该范式依赖于离线策略评估。
- 探究尽管设计精巧,为何迭代算法在实践中常常表现不佳。
- 证明简单的一步策略改进基线方法可在标准离线强化学习基准上超越复杂的迭代方法。
- 识别出迭代算法仍可能优于一步基线方法的条件。
- 为实践者提供在离线强化学习中何时使用一步法与迭代法的实用指导。
提出的方法
- 该方法利用行为策略的在线策略Q估计执行一次策略改进步骤,完全避免了离线策略评估。
- 采用约束或正则化的策略更新,以确保新策略与行为策略分布保持接近。
- 该算法依赖于从离线数据集中直接计算出的行为策略Q函数 $ \widehat{Q}^\beta $ 来指导策略改进。
- 通过使用正则化目标进行单步优化,防止策略从行为数据中产生分布漂移。
- 该方法避免了迭代优化和动态规划步骤,从而减少了离线策略Q估计中误差放大的问题。
- 超参数在少量环境中进行调优,符合离线强化学习中的标准实践。
实验结果
研究问题
- RQ1为何在离线强化学习中,尽管设计精巧,迭代演员-critic算法仍常常表现不佳?
- RQ2在离线强化学习中,简单的一步策略改进方法能否超越复杂的迭代算法?
- RQ3哪些离线策略评估的失败模式会降低迭代算法的性能?
- RQ4在何种条件下,离线策略评估足够可靠,足以证明使用迭代方法的合理性?
- RQ5在离线强化学习中,与迭代方法相比,一步基线方法在何时更具优势?
主要发现
- 该一步算法在D4RL基准套件的大多数任务中,包括大部分Gym-MuJoCo和Adroit环境,优于以往报告的迭代算法结果。
- 该方法在大多数任务上实现了最先进性能,且相较于迭代方法,显著更简单、对超参数选择更具鲁棒性。
- 离线策略评估中的高方差,尤其是在重复策略优化过程中被加剧,被识别为迭代算法失败的主要原因。
- 通过实证验证,分布漂移和迭代偏差放大被确认为迭代方法中的关键失败模式。
- 当行为策略具有良好的状态-动作覆盖且数据集较大时,迭代算法可优于一步基线方法。
- 实证结果表明,即使仅使用少量中等覆盖度的行为数据(例如混合数据中10%的中等数据),一步方法仍优于迭代方法,表明该基线方法具有极强的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。