[论文解读] Policy Representation via Diffusion Probability Model for Reinforcement Learning
本文提出了 DIPO,这是首个使用扩散概率模型表示策略的无模型在线强化学习算法,能够实现多模态动作分布。通过将策略建模为受随机微分方程控制的随机过程,并提供收敛性保证,DIPO 在 MuJoCo 连续控制基准测试中实现了更优的探索能力和性能。
Popular reinforcement learning (RL) algorithms tend to produce a unimodal policy distribution, which weakens the expressiveness of complicated policy and decays the ability of exploration. The diffusion probability model is powerful to learn complicated multimodal distributions, which has shown promising and potential applications to RL. In this paper, we formally build a theoretical foundation of policy representation via the diffusion probability model and provide practical implementations of diffusion policy for online model-free RL. Concretely, we character diffusion policy as a stochastic process, which is a new approach to representing a policy. Then we present a convergence guarantee for diffusion policy, which provides a theory to understand the multimodality of diffusion policy. Furthermore, we propose the DIPO which is an implementation for model-free online RL with DIffusion POlicy. To the best of our knowledge, DIPO is the first algorithm to solve model-free online RL problems with the diffusion model. Finally, extensive empirical results show the effectiveness and superiority of DIPO on the standard continuous control Mujoco benchmark.
研究动机与目标
- 解决深度强化学习中单峰策略表示的局限性,该局限性限制了探索能力并可能导致陷入局部最优。
- 通过随机微分方程的形式化表达,将扩散策略作为随机过程,以实现表达能力强、多模态的策略学习。
- 为扩散策略提供收敛性保证,以确保学习的稳定性,并深化对其多模态行为的理论理解。
- 设计并实现 DIPO,这是首个基于扩散策略的无模型在线强化学习算法,能够在连续控制任务中实现高效且有效的训练。
- 通过实证结果表明,基于扩散的策略在 MuJoCo 环境中展现出更广的探索范围和更高的最终性能,优于标准方法。
提出的方法
- 将策略建模为由随机微分方程(SDE)驱动的随机过程,将扩散策略表示为连续时间的马尔可夫过程。
- 使用指数积分器离散化方法数值求解 SDE,从而在训练过程中实现稳定且可微的策略轨迹采样。
- 将训练目标表述为期望回报的变分下界,通过最小化前向与反向扩散过程之间的 KL 散度来优化。
- 将扩散策略整合到无模型强化学习框架中,采用动作梯度更新机制,支持在线交互与策略改进。
- 应用 Donsker-Varadhan 表示法,推导出 KL 散度的时间导数,从而实现端到端训练,结合策略梯度信号。
- 通过神经网络实现 DIPO,该网络可预测反向扩散过程中所需的噪声,使策略能够生成多样化且高回报的动作。

实验结果
研究问题
- RQ1如何在强化学习中正式地将扩散概率模型作为策略表示?
- RQ2扩散策略的收敛性与多模态表达能力具有哪些理论保证?
- RQ3能否在不依赖动力学模型的前提下,有效将扩散策略集成到无模型在线强化学习算法中?
- RQ4在复杂的连续控制任务中,扩散策略的探索行为与标准单峰策略相比有何差异?
- RQ5基于扩散的策略在性能上相对于 SAC、PPO 和 TD3 等最先进算法的表现如何?
主要发现
- DIPO 在所有 MuJoCo 连续控制基准测试中均达到最先进性能,其最终回报与样本效率均优于 PPO、SAC 和 TD3。
- DIPO 在训练过程中展现出更广泛且更有效的状态访问行为,该行为与更优的初始性能和最终性能相关,表明其探索能力更优。
- 该算法自然地实现了从广泛探索到聚焦利用的过渡,与最优强化学习行为一致;而 PPO 则表现出反直觉的探索模式。
- 消融实验表明,若将扩散模型替换为 VAE 或 MLP,则性能显著下降,证实了扩散模型在策略表示中的优越性。
- MLP 配合动作梯度方法表现出意外的优异性能,接近 SAC 和 DIPO 等复杂算法的性能,表明简单但高效的强化学习架构具有广阔前景。
- 理论分析证实,在较弱条件下扩散策略可实现收敛,为其在强化学习中的应用提供了严谨的理论基础。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。