Skip to main content
QUICK REVIEW

[论文解读] Promoting Coordination through Policy Regularization in Multi-Agent Deep Reinforcement Learning

Julien Le Roy, Paul Barde|arXiv (Cornell University)|Aug 6, 2019
Reinforcement Learning in Robotics参考文献 37被引用 13
一句话总结

本文提出了两种策略正则化方法——TeamReg和CoachReg,通过鼓励智能体预测队友动作或同步子策略选择,以提升多智能体深度强化学习(MARL)中的协作性能。实验表明,CoachReg在稀疏奖励的连续控制任务以及离散动作的Google Research Football环境中显著提升了性能,而TeamReg则提供了有助于协作但依赖任务的信号。

ABSTRACT

In multi-agent reinforcement learning, discovering successful collective behaviors is challenging as it requires exploring a joint action space that grows exponentially with the number of agents. While the tractability of independent agent-wise exploration is appealing, this approach fails on tasks that require elaborate group strategies. We argue that coordinating the agents' policies can guide their exploration and we investigate techniques to promote such an inductive bias. We propose two policy regularization methods: TeamReg, which is based on inter-agent action predictability and CoachReg that relies on synchronized behavior selection. We evaluate each approach on four challenging continuous control tasks with sparse rewards that require varying levels of coordination as well as on the discrete action Google Research Football environment. Our experiments show improved performance across many cooperative multi-agent problems. Finally, we analyze the effects of our proposed methods on the policies that our agents learn and show that our methods successfully enforce the qualities that we propose as proxies for coordinated behaviors.

研究动机与目标

  • 解决多智能体强化学习中联合动作空间随智能体数量呈指数级增长所带来的协作行为发现挑战。
  • 克服MARL中独立探索的局限性,后者在需要复杂群体策略的任务中常会失效。
  • 向策略学习中引入归纳偏置,引导探索朝向协作行为,而无需依赖任务特定的奖励设计。
  • 在连续动作和离散动作环境中评估促进协作的正则化器的有效性,包括具有挑战性的稀疏奖励场景。
  • 分析所提出方法如何塑造学习到的策略,以促进可预测且同步的行为,从而体现真正的协作。

提出的方法

  • 提出TeamReg,一种正则化方法,通过共享的动作预测头使每个智能体预测其队友的动作,从而促进智能体间的可预测性。
  • 引入CoachReg,通过训练智能体识别共享环境状态并同步行动,实现子策略选择的同步。
  • 将两种正则化器集成到集中训练、分散执行(CTDE)框架中,与主回报最大化目标联合优化。
  • 使用集中式评论器基于联合动作提供价值估计,使策略正则化器能够引导学习朝向高回报的协作策略。
  • 以MADDPG作为基础算法,在集中训练过程中扩展新的正则化目标,同时保持推理阶段的去中心化特性。
  • 将方法应用于连续控制任务(如多智能体粒子环境)和离散动作的Google Research Football环境,以验证泛化能力。

实验结果

研究问题

  • RQ1是否可通过促进智能体间动作可预测性的策略正则化(TeamReg)提升协作MARL任务中的样本效率和性能?
  • RQ2是否通过强制同步子策略选择(CoachReg)能实现更有效的协作并加快多智能体环境中的收敛速度?
  • RQ3在稀疏奖励环境中,这些正则化方法表现如何,其中成功的协作行为难以通过随机探索发现?
  • RQ4TeamReg在哪些环境中能提供优势,而在哪些环境中可能产生负面影响,例如对抗性环境?
  • RQ5所提出方法在多大程度上能生成表现出可测量协作的行为,如可预测或同步的行为?

主要发现

  • CoachReg在所有评估环境中均持续提升性能,包括具有挑战性的3vs2 Google Research Football场景,其中仅MADDPG + CoachReg实现了0.088 ± 0.017的正向平均回报。
  • TeamReg提供了密集的学习信号,有助于在缺乏外部奖励的情况下发现协作策略,尤其在需要相互预期的任务中表现突出。
  • 在多智能体粒子环境中,CoachReg在3vs2任务中实现了0.088 ± 0.017的平均回报,显著优于基线MADDPG和MADDPG + TeamReg。
  • TeamReg表现参差不齐:在部分任务中提升了性能,但在包含竞争成分的环境中则产生负面影响,表明其效果具有任务依赖性。
  • 消融实验确认,两种正则化器显著改变了策略行为,如预期般提高了智能体间动作的可预测性与子策略的同步性。
  • 这些方法成功地强制实现了预期的协作代理——可预测性与同步性,证明策略正则化可有效将协作归纳偏置嵌入MARL训练中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。