[论文解读] Non-local Policy Optimization via Diversity-regularized Collaborative Exploration
该论文提出了一种非局部策略优化框架——多样性正则化协作探索(DiCE),通过一组异构智能体协作探索状态-动作空间,同时利用正则化机制保持行为多样性。在MuJoCo运动控制环境中,DiCE显著提升了样本效率和最终性能,相较于PPO和SAC基线模型,在Ant-v3中回报最高提升2.3倍,在Humanoid-v3中提升1.8倍。
Conventional Reinforcement Learning (RL) algorithms usually have one single agent learning to solve the task independently. As a result, the agent can only explore a limited part of the state-action space while the learned behavior is highly correlated to the agent's previous experience, making the training prone to a local minimum. In this work, we empower RL with the capability of teamwork and propose a novel non-local policy optimization framework called Diversity-regularized Collaborative Exploration (DiCE). DiCE utilizes a group of heterogeneous agents to explore the environment simultaneously and share the collected experiences. A regularization mechanism is further designed to maintain the diversity of the team and modulate the exploration. We implement the framework in both on-policy and off-policy settings and the experimental results show that DiCE can achieve substantial improvement over the baselines in the MuJoCo locomotion tasks.
研究动机与目标
- 为解决单智能体强化学习中因自身策略与经验受限而导致的局部探索局限性。
- 通过利用一组异构智能体共享经验并探索状态-动作空间的不同区域,实现非局部探索。
- 在并发训练过程中保持智能体间的行为多样性,防止收敛至相似且次优的策略。
- 设计一种高效、紧凑的多样性正则化机制,避免使用昂贵的自编码器或手工设计的表征。
- 在具有挑战性的MuJoCo运动控制任务中,于策略学习与离策略学习设置下验证该框架的有效性。
提出的方法
- DiCE采用一组异构智能体,各自独立与环境交互,并共享所收集的经验。
- 一个中心化回放缓冲区存储共享经验,使所有智能体能够从同一数据池中学习。
- 基于可行方向法的多样性正则化机制调节策略更新,以保持智能体间的行为多样性。
- 一个紧凑的多样性值网络(DVN)估计多样性值,以引导探索,避免使用自编码器或手工设计的特征。
- 框架整合了双侧裁剪损失、归一化优势与延迟目标更新,以稳定训练过程。
- DiCE在策略学习(如A2C、PPO)与离策略学习(如SAC)算法中均有实现,并对关键组件进行了消融研究。
实验结果
研究问题
- RQ1通过异构智能体的协作探索,是否能显著扩展有效探索空间,突破局部极小值?
- RQ2一种紧凑且可学习的多样性正则化机制是否能提升连续控制任务中的样本效率与最终性能?
- RQ3团队规模如何影响DiCE中协作探索的性能与稳定性?
- RQ4DiCE在MuJoCo运动控制环境中相较于标准基线方法(如PPO与SAC)的性能优势有多大?
- RQ5各个组件(如DVN、归一化、多样性正则化)对DiCE整体性能的贡献如何?
主要发现
- 在Ant-v3中,DiCE实现了2517.65的平均回报,显著超过策略学习设置下的PPO基线(1230.82)与SAC(4825.35)。
- 在Humanoid-v3中,DiCE达到566.88的平均回报,在离策略设置下相较PPO(453.09)提升16%,相较SAC(5046.93)提升12%。
- 最优团队规模为K=7;当K=10时性能下降,因过度多样性削弱了策略质量。
- 消融研究显示,禁用协作探索(w/o CE)导致训练崩溃,而移除优势归一化则严重损害性能。
- 在Ant-v3中,多样性值网络(DVN)因多样性信号不稳定而损害性能,但在Walker2d-v3中影响较小,表明其对任务具有依赖性敏感性。
- DiCE-SAC通过独立的多样性评论家在Walker2d-v3中达到4784.59的回报,优于标准SAC(4293.26),证明了该方法的鲁棒性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。