Skip to main content
QUICK REVIEW

[论文解读] Muesli: Combining Improvements in Policy Optimization

Matteo Hessel, Ivo Danihelka|arXiv (Cornell University)|Apr 13, 2021
Reinforcement Learning in Robotics参考文献 88被引用 12
一句话总结

Muesli 提出了一种新颖的策略优化方法,将正则化策略优化与基于模型的一步前瞻价值估计相结合,在无需深度搜索的情况下实现了 Atari 游戏上的最先进性能。该方法仅使用策略网络和一步规划,便达到了 MuZero 的性能水平,同时保持了与无模型方法相当的计算速度。

ABSTRACT

We propose a novel policy update that combines regularized policy optimization with model learning as an auxiliary loss. The update (henceforth Muesli) matches MuZero's state-of-the-art performance on Atari. Notably, Muesli does so without using deep search: it acts directly with a policy network and has computation speed comparable to model-free baselines. The Atari results are complemented by extensive ablations, and by additional results on continuous control and 9x9 Go.

研究动机与目标

  • 开发一种无需依赖深度搜索或规划即可在 Atari 上实现最先进性能的策略优化方法。
  • 将基于模型的价值估计整合到正则化策略优化中,以提升样本效率和鲁棒性。
  • 通过直接使用策略网络进行推理,避免树搜索的延迟,从而保持高计算效率。
  • 在包括连续控制和 9x9 围棋在内的多样化环境中评估泛化能力。
  • 对方法的关键组件进行消融分析,以理解其对性能的贡献。

提出的方法

  • Muesli 使用受 MuZero 启发的模型,通过一步前瞻估计动作价值,提供自举式的价值目标。
  • 在最大后验概率策略优化(MPO)框架内采用截断归一化优势机制,以稳定训练并避免缩放问题。
  • 策略更新采用截断 MPO 目标与策略梯度相结合的直接端到端优化方案。
  • 引入与动作相关的基线(β-LOO)以降低策略梯度估计的方差。
  • 该方法使用共享神经网络进行策略和价值函数估计,实现高效的参数共享。
  • 其运行环境为无模型设置,但通过将学习到的模型作为辅助损失来提升策略学习效果。

实验结果

研究问题

  • RQ1将正则化策略优化与基于模型的价值估计相结合,是否能在无需深度搜索的情况下实现 Atari 上的最先进性能?
  • RQ2使用一步基于模型的价值估计在多大程度上提升了样本效率和训练稳定性?
  • RQ3截断归一化优势和与动作相关的基线对策略优化性能的贡献是什么?
  • RQ4Muesli 在连续控制和小棋盘围棋环境中的泛化能力如何?
  • RQ5在 Atari 上,哪些消融组件对性能影响最为关键?

主要发现

  • Muesli 在 57 个 Atari 游戏上无需深度搜索即可达到与 MuZero 相当的中位人类归一化得分,在标准 75% 回放设置下得分为 139,409 ± 12,178。
  • 在大规模 MuZero 设置下(95% 回放,更大的网络),Muesli 得分为 1,363,427 ± 81,093,优于 MuZero 报告的得分 1,355,410 ± 65,349。
  • 消融研究显示,使用 β-LOO 基线能显著提升性能,而使用温度参数的 Softmax 或无 CMPO 的直接策略执行则导致性能下降。
  • 该方法在连续控制环境中的泛化能力良好,在 MuJoCo 基准测试中表现出色。
  • 在 9x9 围棋中,Muesli 实现了强大的自对弈性能,表明其在传统上依赖蒙特卡洛树搜索的领域中同样有效。
  • 对堆叠帧的消融分析表明,Muesli 在不同观测历史下均能保持性能,显示出对输入表示的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。