Skip to main content
QUICK REVIEW

[论文解读] Scalable Multi-Agent Inverse Reinforcement Learning via Actor-Attention-Critic

Wonseok Jeon, Paul Barde|arXiv (Cornell University)|Feb 24, 2020
Reinforcement Learning in Robotics参考文献 27被引用 7
一句话总结

本文提出 MA-DAAC,一种可扩展且样本高效的多智能体逆强化学习方法,利用多智能体演员-注意力评论家(MAAC)提升训练效率与可扩展性。通过采用基于注意力机制的评论家进行去中心化判别器设计,MA-DAAC 在小规模与大规模多智能体环境中均显著优于基线方法,实现更少的环境交互次数并更优地模仿专家行为。

ABSTRACT

Multi-agent adversarial inverse reinforcement learning (MA-AIRL) is a recent approach that applies single-agent AIRL to multi-agent problems where we seek to recover both policies for our agents and reward functions that promote expert-like behavior. While MA-AIRL has promising results on cooperative and competitive tasks, it is sample-inefficient and has only been validated empirically for small numbers of agents -- its ability to scale to many agents remains an open question. We propose a multi-agent inverse RL algorithm that is more sample-efficient and scalable than previous works. Specifically, we employ multi-agent actor-attention-critic (MAAC) -- an off-policy multi-agent RL (MARL) method -- for the RL inner loop of the inverse RL procedure. In doing so, we are able to increase sample efficiency compared to state-of-the-art baselines, across both small- and large-scale tasks. Moreover, the RL agents trained on the rewards recovered by our method better match the experts than those trained on the rewards derived from the baselines. Finally, our method requires far fewer agent-environment interactions, particularly as the number of agents increases.

研究动机与目标

  • 解决现有多智能体逆强化学习(MA-AIRL)方法存在的样本效率低下与可扩展性差的问题。
  • 通过用更高效的多智能体强化学习(MARL)框架替代基线方法中的 MACK 算法,提升多智能体逆强化学习中的样本效率与可扩展性。
  • 在去中心化训练设置中,利用基于注意力机制的集中式评论家,实现在更少专家演示下稳健的逆学习。
  • 证明 MA-DAAC 学习到的奖励函数可带来优于先前方法的策略性能。
  • 验证去中心化判别器在无集中观测访问条件下,能否有效捕捉协作模式。

提出的方法

  • 该方法采用多智能体演员-注意力评论家(MAAC),一种基于共享注意力机制的异策略多智能体强化学习算法,可扩展至大量智能体。
  • 其整合了对抗性逆强化学习框架,其中判别器通过联合观测与动作区分专家轨迹与智能体生成的轨迹。
  • MAAC 中的评论家网络使用多头自注意力机制,以建模智能体间的依赖关系,实现在高维联合动作空间中的高效价值函数近似。
  • 策略通过基于判别器输出的奖励信号进行策略梯度更新,而判别器则通过最小化专家行为与智能体行为分布之间的差异进行训练。
  • 该框架采用对每个智能体独立运行的去中心化判别器,仅依赖个体观测与动作,降低输入维度,提升可扩展性。
  • 该方法通过新提出的性能指标——重训练得分(NSS),评估恢复奖励函数的质量。

实验结果

研究问题

  • RQ1多智能体逆强化学习方法是否能在不同智能体数量下,实现优于最先进基线方法的样本效率?
  • RQ2在去中心化多智能体强化学习框架中使用基于注意力机制的评论家,是否能提升多智能体逆强化学习的可扩展性与性能?
  • RQ3当专家演示数量有限时,MA-DAAC 与 MA-AIRL 在模仿质量与奖励恢复方面表现如何比较?
  • RQ4在无集中观测访问条件下,去中心化判别器是否能有效学习协作模式,特别是在部分可观察环境(如协作通信)中?
  • RQ5在逆强化学习中,学习到的奖励与真实奖励之间的高相关性是否为实现专家级行为的必要条件?”

主要发现

  • 在所有任务中,MA-DAAC 的重训练得分(NSS)显著高于 MA-AIRL,表明基于恢复奖励训练的策略更贴近专家行为。
  • 与 MA-AIRL 相比,该方法将所需智能体-环境交互次数减少了高达 50%,尤其在智能体数量增加时更为显著。
  • 即使仅提供 10 个专家演示,MA-DAAC 仍保持高性能,而 MA-AIRL 在低数据设置下性能急剧下降。
  • 学习到的奖励与真实奖励之间的皮尔逊相关系数并非性能的可靠指标,因为高相关性并不保证实现专家级模仿。
  • 去中心化判别器结合基于注意力机制的评论家,可在部分可观察环境(如协作通信)中成功捕捉多智能体任务的协作模式。
  • 注意力机制的使用使评论家能够泛化于智能体间交互,提升可扩展性,同时不牺牲样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。