Skip to main content
QUICK REVIEW

[论文解读] Independent Generative Adversarial Self-Imitation Learning in Cooperative Multiagent Systems

Xiaotian Hao, Weixun Wang|arXiv (Cornell University)|Sep 25, 2019
Reinforcement Learning in Robotics被引用 12
一句话总结

本文提出了一种新型协作多智能体强化学习框架——独立生成对抗自模仿学习(IGASIL),使完全去中心化的智能体能够通过自模仿和生成对抗模仿学习实现协调。通过结合子课程经验回放机制与对抗性模仿学习,IGASIL在《星际争霸》单位微操与野生动物救援任务中均实现了最先进性能,其收敛速度与最终回报均优于联合动作学习方法。

ABSTRACT

Many tasks in practice require the collaboration of multiple agents through reinforcement learning. In general, cooperative multiagent reinforcement learning algorithms can be classified into two paradigms: Joint Action Learners (JALs) and Independent Learners (ILs). In many practical applications, agents are unable to observe other agents' actions and rewards, making JALs inapplicable. In this work, we focus on independent learning paradigm in which each agent makes decisions based on its local observations only. However, learning is challenging in independent settings due to the local viewpoints of all agents, which perceive the world as a non-stationary environment due to the concurrently exploring teammates. In this paper, we propose a novel framework called Independent Generative Adversarial Self-Imitation Learning (IGASIL) to address the coordination problems in fully cooperative multiagent environments. To the best of our knowledge, we are the first to combine self-imitation learning with generative adversarial imitation learning (GAIL) and apply it to cooperative multiagent systems. Besides, we put forward a Sub-Curriculum Experience Replay mechanism to pick out the past beneficial experiences as much as possible and accelerate the self-imitation learning process. Evaluations conducted in the testbed of StarCraft unit micromanagement and a commonly adopted benchmark show that our IGASIL produces state-of-the-art results and even outperforms JALs in terms of both convergence speed and final performance.

研究动机与目标

  • 解决完全协作多智能体系统中智能体无法观测其他智能体动作或奖励的协调挑战。
  • 通过使智能体从自身过往成功经验中学习,克服独立学习中的非平稳性问题。
  • 在传统基于Q-learning的IL方法不适用的连续控制任务中,提升样本效率与收敛速度。
  • 开发一种无需依赖中心化评论器或联合动作空间的完全去中心化、独立学习框架。
  • 证明自模仿与GAIL的结合可在复杂协作环境中超越现有独立与联合学习范式。

提出的方法

  • 每个智能体维护两个经验缓冲区:用于一般轨迹的普通缓冲区,以及用于存储高性能轨迹的正样本(子课程)缓冲区。
  • 子课程经验回放机制从过往成功经验中提取有用的子轨迹,并存入正样本缓冲区,以加速自模仿学习。
  • 训练一个生成对抗模仿学习(GAIL)判别器,以区分来自正样本缓冲区的专家式示范与当前行为,从而指导策略优化。
  • 通过利用判别器的奖励信号,对智能体自身过往高质量经验进行策略微调,实现自模仿。
  • 该框架采用异策略学习方式,支持高效经验回放与样本复用,尤其在稀疏奖励环境中表现优异。
  • 该方法完全去中心化,每个智能体仅基于自身观测与经验进行学习,无需了解其他智能体的策略。

实验结果

研究问题

  • RQ1自模仿学习能否与生成对抗模仿学习有效结合,以提升独立多智能体系统中的协调能力?
  • RQ2所提出的子课程经验回放机制是否能显著加速学习并提升协作任务中的策略性能?
  • RQ3一种独立且去中心化的框架是否能在协作多智能体环境中实现与联合动作学习者相当或更优的性能?
  • RQ4在复杂协作任务中,IGASIL的异策略变体相较于其同策略变体,样本效率如何?
  • RQ5正样本缓冲区中存储经验的质量在多大程度上与训练过程中智能体性能的提升相关?

主要发现

  • IGASIL在《星际争霸》单位微操与协作濒危野生动物救援任务中均实现了最先进性能,其收敛速度与最终回报均优于现有方法。
  • IGASIL的异策略版本在动物救援任务中仅需约十分之一的样本量即可达到专家级性能,远低于同策略版本。
  • 子课程经验回放机制显著加速了学习进程,IAC+SCER在两种场景下均优于IAC+PER与基线IAC。
  • 随着训练推进,正样本缓冲区中存储经验 $M_E^i$ 的质量持续提升,从而带来更优的策略学习与更高的平均回报。
  • 每轮中击杀敌人的数量与存储经验的质量同步增加,证实了更优子技能被有效学习并复用。
  • IGASIL在样本效率与收敛速度方面均优于同策略与异策略基线方法,甚至在性能指标上超越了联合动作学习者。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。