Skip to main content
QUICK REVIEW

[论文解读] Efficient Diffusion Policies for Offline Reinforcement Learning

Bingyi Kang, Xiao Ma|arXiv (Cornell University)|May 31, 2023
Robotic Locomotion and Control被引用 5
一句话总结

本文提出高效扩散策略(EDP),通过在训练过程中从受损状态近似动作,避免了昂贵的扩散采样链,从而加速离线强化学习。EDP将训练速度提升至原始Diffusion-QL的25倍(5小时 vs. 5天),并在所有D4RL领域中达到新的最先进性能,支持基于价值和似然的强化学习算法,显著提升样本效率与泛化能力。

ABSTRACT

Offline reinforcement learning (RL) aims to learn optimal policies from offline datasets, where the parameterization of policies is crucial but often overlooked. Recently, Diffsuion-QL significantly boosts the performance of offline RL by representing a policy with a diffusion model, whose success relies on a parametrized Markov Chain with hundreds of steps for sampling. However, Diffusion-QL suffers from two critical limitations. 1) It is computationally inefficient to forward and backward through the whole Markov chain during training. 2) It is incompatible with maximum likelihood-based RL algorithms (e.g., policy gradient methods) as the likelihood of diffusion models is intractable. Therefore, we propose efficient diffusion policy (EDP) to overcome these two challenges. EDP approximately constructs actions from corrupted ones at training to avoid running the sampling chain. We conduct extensive experiments on the D4RL benchmark. The results show that EDP can reduce the diffusion policy training time from 5 days to 5 hours on gym-locomotion tasks. Moreover, we show that EDP is compatible with various offline RL algorithms (TD3, CRR, and IQL) and achieves new state-of-the-art on D4RL by large margins over previous methods. Our code is available at https://github.com/sail-sg/edp.

研究动机与目标

  • 为解决离线强化学习中训练扩散策略时计算效率低下的问题,该问题需要在长马尔可夫链上执行完整的前向与反向传播。
  • 使扩散策略能够兼容需要可计算对数似然的似然性强化学习算法(如IQL、CRR)。
  • 开发一种通用、高效且可扩展的策略参数化方法,在复杂、多模态的离线数据集上优于标准高斯策略。
  • 证明扩散策略在离线强化学习基准中可实现更快训练速度与更优性能。

提出的方法

  • EDP使用去噪扩散概率模型(DDPM)学习一个噪声预测网络,通过重参数化将受损动作映射为干净动作。
  • 提出动作近似:不通过完整扩散链采样,而是利用学习到的噪声预测网络从受损输入重建动作,显著降低训练计算量。
  • EDP使用固定方差的高斯分布近似策略似然,其均值由动作近似得出,从而实现与IQL、CRR等似然性算法的兼容。
  • 集成基于ODE的采样器DPM-Solver,通过减少采样所需模型调用次数,加速训练与推理过程。
  • 推理阶段应用基于能量的动作选择(EAS),使用10个动作作为效率与性能之间的权衡。
  • 该方法在多种离线强化学习算法(TD3、CRR、IQL)和环境(gym-locomotion、AntMaze、Adroit、Kitchen)上进行了评估,展示了广泛的兼容性与性能提升。

实验结果

研究问题

  • RQ1我们能否在不牺牲性能的前提下,显著缩短离线强化学习中扩散策略的训练时间?
  • RQ2我们能否使扩散策略兼容如IQL和CRR等需要可计算对数似然的似然性强化学习算法?
  • RQ3所提出的动作近似方法是否能保持或优于完整扩散采样的样本质量与策略性能?
  • RQ4EDP能否在多样化的离线强化学习算法与基准环境中实现泛化,达到最先进性能?

主要发现

  • 在D4RL gym-locomotion任务上,EDP将训练时间从5天缩短至5小时,相比Diffusion-QL实现25倍加速。
  • EDP在D4RL四个领域均达到新的最先进性能,RAT指标下平均得分分别为:85.5(gym-locomotion)、63.0(AntMaze)、73.4(Adroit)和43.8(Kitchen)。
  • 在AntMaze、Adroit和Kitchen任务上,EDP + IQL的平均得分超过所有基线10分以上,表明在复杂、多模态任务中具有显著性能优势。
  • EDP在TD3、CRR和IQL上均保持或提升性能,表明其在所有算法与环境上均优于标准高斯策略,具备良好兼容性与优越性。
  • 消融实验表明,OMS(最优)得分可能因训练不稳定性而产生误导,而RAT(平均)提供更可靠的评估指标。
  • 在DPM-Solver中使用15次模型调用即可实现接近最优的性能,且效率良好;在EAS中增加动作数量可在9项任务中的8项上单调提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。