[论文解读] Learning and Planning in Complex Action Spaces
本文提出了 Sampled MuZero,一种在复杂动作空间(连续、高维或结构化)中进行强化学习的通用框架,通过采样动作而非枚举动作来实现。通过将基于采样的策略评估与改进整合进 MuZero 的规划循环,该方法在离散动作空间(如围棋)和连续控制基准(如 DeepMind Control Suite、Real-World RL Suite)中均表现出色,即使仅使用 K=5 个动作样本,也优于以往方法。
Many important real-world problems have action spaces that are high-dimensional, continuous or both, making full enumeration of all possible actions infeasible. Instead, only small subsets of actions can be sampled for the purpose of policy evaluation and improvement. In this paper, we propose a general framework to reason in a principled way about policy evaluation and improvement over such sampled action subsets. This sample-based policy iteration framework can in principle be applied to any reinforcement learning algorithm based upon policy iteration. Concretely, we propose Sampled MuZero, an extension of the MuZero algorithm that is able to learn in domains with arbitrarily complex action spaces by planning over sampled actions. We demonstrate this approach on the classical board game of Go and on two continuous control benchmark domains: DeepMind Control Suite and Real-World RL Suite.
研究动机与目标
- 解决将基于模型的强化学习应用于高维、连续或结构化动作空间环境的挑战,其中完整枚举所有动作不可行。
- 构建一个严谨的框架,用于基于采样子集对策略进行评估与改进,确保在局部采样条件下仍能实现全局策略性能。
- 通过基于采样的规划机制,将 MuZero 算法扩展至支持复杂动作空间,从而可应用于真实世界控制任务。
- 在多样化的基准测试中展示该方法的鲁棒性与可扩展性,包括连续控制和部分可观察环境。
提出的方法
- 提出一种基于采样的策略迭代框架,使用少量采样子集进行策略评估与改进,而非枚举所有动作。
- 在树搜索中引入改进的 PUCT 公式,引入行为策略 $π_{\beta}$ 以稳定学习并提升样本效率。
- 将基于采样的框架集成进 MuZero 的基于模型的规划循环,实现在采样子集上进行规划的同时保持全局策略优化。
- 使用训练好的环境模型从采样动作中滚动轨迹,实现在推理阶段无需与环境交互即可进行长时程规划。
- 在使用 LSTM 处理部分可观察性的统一架构下,将该方法应用于离散(围棋)和连续(dmControl、RWRL)控制任务。
- 利用离策略学习与分布式 Q 函数估计,提升高维动作空间中的样本效率与稳定性。
实验结果
研究问题
- RQ1是否可以有效将基于采样的策略迭代框架应用于无需完整枚举的动作空间?
- RQ2在基于模型的规划中,动作采样如何影响策略评估与改进?该方法能否在理论上成立?
- RQ3能否通过采样方式将 MuZero 算法扩展至处理连续与高维动作空间,同时保持样本效率与性能?
- RQ4该方法在低样本数量(如 K=5)下是否具有鲁棒性?是否能在多样化环境中泛化?
- RQ5在 PUCT 公式中使用行为策略 $\pi_{\beta}$ 是否相比直接使用主策略 $\pi$ 能够提升稳定性和性能?
主要发现
- Sampled MuZero 在 DeepMind Control Suite 上实现了最先进性能,优于 D4PG 和 DMPO 在所有任务上的表现,包括 56 维的 humanoid,且环境交互次数减少了一个多数量级。
- 在 Real-World RL 基准测试中,Sampled MuZero 显著优于 DMPO、D4PG 和 STACX 在所有难度等级的表现,尤其在高维 humanoid 任务中表现突出,分别在简单、中等和困难版本中达到 289.36、108.56 和 1.19 的得分。
- 该算法在仅使用 K=5 个采样动作的情况下仍保持强劲性能,展现出极高的样本效率,并可扩展至复杂动作空间。
- 稳定性分析表明,使用 $\hat{\pi}_{\beta}$ 替代直接使用 $\pi$ 的 PUCT 公式,显著提升了方法的鲁棒性与可复现性。
- Sampled MuZero 仅通过原始像素输入即成功控制了 21 维 humanoid,实现高性能,且无需动作重复、观测重建或超参数调优。
- 在直接对比中,Sampled MuZero 在 DeepMind Control Suite 的所有任务中均达到或超越 Dreamer 代理的性能,尽管未使用动作重复或观测重建。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。