[论文解读] The Differentiable Cross-Entropy Method
本文提出可微分交叉熵方法(DCEM),一种可微分的交叉熵方法(CEM)变体,通过平滑的 top-k 操作实现对非凸、连续优化过程的反向传播。DCEM 允许在基于模型的强化学习中对基于 CEM 的控制器进行端到端训练,结合 PPO 算法实现策略优化,将样本复杂度降低一个数量级,同时达到接近最优的性能表现。
We study the cross-entropy method (CEM) for the non-convex optimization of a continuous and parameterized objective function and introduce a differentiable variant that enables us to differentiate the output of CEM with respect to the objective function's parameters. In the machine learning setting this brings CEM inside of the end-to-end learning pipeline where this has otherwise been impossible. We show applications in a synthetic energy-based structured prediction task and in non-convex continuous control. In the control setting we show how to embed optimal action sequences into a lower-dimensional space. DCEM enables us to fine-tune CEM-based controllers with policy optimization.
研究动机与目标
- 在非凸、连续设置下,实现通过交叉熵方法(CEM)的端到端可微分优化。
- 解决基于模型的强化学习中的目标不匹配问题,即最大似然训练与控制目标之间的冲突。
- 利用如 PPO 等策略优化方法对基于 CEM 的控制器进行微调。
- 通过将动作序列嵌入低维空间,降低连续控制中的计算与内存开销。
- 为基于优化的机器学习组件提供一种可微分的替代方案,以替代展开的梯度下降。
提出的方法
- 提出 DCEM,一种基于 Amos 等人(2019)提出的平滑 top-k 操作的可微分 CEM 变体,以实现对 argmin 操作的梯度计算。
- 将 DCEM 应用于近似求解形式为 $\hat{x} = \arg\min_x f_\theta(x)$ 的非凸优化问题,其中 $f_\theta$ 由参数 $\theta$ 参数化。
- 将 DCEM 控制器作为可微分策略类 $\pi_\theta(x_{\text{init}})$ 使用,以实现与 PPO 等策略优化流水线的集成。
- 采用潜在空间解码器 $f^{\text{dec}}$ 将潜在编码映射为动作序列,并使用 DCEM 实现解码器的端到端优化。
- 通过最大似然训练模型组件(解码器、奖励模型、转移模型),随后使用 PPO 对其进行微调,以提升控制性能。
- 采用在线训练结合 DCEM,以保持可微性,并实现在连续控制任务中的实时自适应。
实验结果
研究问题
- RQ1交叉熵方法能否被改造为可微分形式,以实现在非凸优化中的端到端学习?
- RQ2在能量模型学习中,DCEM 是否在泛化性和鲁棒性方面优于展开的梯度下降?
- RQ3DCEM 是否可用于将动作序列嵌入低维空间,从而降低连续控制中的计算成本?
- RQ4如 PPO 等策略优化方法能否有效微调通过最大似然训练的基于 CEM 的控制器?
- RQ5DCEM 是否能缓解基于模型的强化学习中的目标不匹配问题?
主要发现
- DCEM 在连续控制中将轨迹样本数量减少了一个数量级(1,000 vs. 100,000),同时达到接近最优的性能表现。
- 在能量模型学习中,DCEM 生成的能量表面比展开梯度下降更为合理,后者容易因梯度步数而过拟合。
- PPO 微调显著缩小了 DCEM 与完整 CEM 之间的性能差距,证明了策略优化的有效性。
- DCEM 实现了基于 CEM 的控制器的端到端训练,使基于模型的组件能够集成到策略优化流水线中。
- 该方法通过将训练目标与控制性能对齐,成功缓解了目标不匹配问题。
- 通过潜在动作空间嵌入,DCEM 实现了计算与内存开销更低的可微分模型控制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。