Skip to main content
QUICK REVIEW

[论文解读] Continuous Coordination As a Realistic Scenario for Lifelong Learning

Hadi Nekoei, Akilesh Badrinaaraayanan|PolyPublie (École Polytechnique de Montréal)|Mar 4, 2021
Reinforcement Learning in Robotics参考文献 59被引用 7
一句话总结

本文提出了 Lifelong Hanabi,这是一个基于合作纸牌游戏 Hanabi 的新型终身强化学习基准,用于建模持续的多智能体协作。通过让智能体依次与大规模策略池中不同预训练智能体协作,该框架实现了零样本泛化,并揭示了终身学习中的关键权衡:持续训练显著提升了不同 MARL 方法在跨伙伴协作中的表现。

ABSTRACT

Current deep reinforcement learning (RL) algorithms are still highly task-specific and lack the ability to generalize to new environments. Lifelong learning (LLL), however, aims at solving multiple tasks sequentially by efficiently transferring and using knowledge between tasks. Despite a surge of interest in lifelong RL in recent years, the lack of a realistic testbed makes robust evaluation of LLL algorithms difficult. Multi-agent RL (MARL), on the other hand, can be seen as a natural scenario for lifelong RL due to its inherent non-stationarity, since the agents' policies change over time. In this work, we introduce a multi-agent lifelong learning testbed that supports both zero-shot and few-shot settings. Our setup is based on Hanabi -- a partially-observable, fully cooperative multi-agent game that has been shown to be challenging for zero-shot coordination. Its large strategy space makes it a desirable environment for lifelong RL tasks. We evaluate several recent MARL methods, and benchmark state-of-the-art LLL algorithms in limited memory and computation regimes to shed light on their strengths and weaknesses. This continual learning paradigm also provides us with a pragmatic way of going beyond centralized training which is the most commonly used training protocol in MARL. We empirically show that the agents trained in our setup are able to coordinate well with unseen agents, without any additional assumptions made by previous works. The code and all pre-trained models are available at https://github.com/chandar-lab/Lifelong-Hanabi.

研究动机与目标

  • 为多智能体设置中的终身强化学习(LLL)缺乏真实且具有挑战性的基准提供解决方案。
  • 通过多样化智能体策略而非人为设计的环境变化来建模非平稳性。
  • 在真实条件下评估 LLL 算法,即智能体必须与未曾见过、此前未遇见过的伙伴协作。
  • 超越集中式训练,实现在持续学习设置下的去中心化、零样本协作。
  • 提供一个可扩展、可复现的基准,通过跨伙伴协作得分量化任务相似性,并衡量正向/负向迁移。

提出的方法

  • Lifelong Hanabi 基于 Hanabi 合作游戏构建,其中一名学习智能体依次与 100 多个使用不同 MARL 方法和随机种子预训练的智能体交互。
  • 任务相似性通过跨伙伴协作(CP)矩阵量化,其中每个条目表示两个智能体协作时的得分,作为策略距离的代理指标。
  • 学习智能体在一系列伙伴智能体上持续训练,模拟具有非平稳策略的终身学习过程。
  • 评估包括三种设置:单次协作(SP)、同方法 CP(相同 MARL 方法)和跨方法 CP(不同 MARL 方法),以评估零样本协作能力。
  • 在内存和计算资源受限条件下,应用并比较了多种 LLL 算法,包括经验回放(ER)、多任务学习(MTL)和参数隔离。
  • 该框架支持对正向迁移(在新伙伴上的表现)和负向迁移(对旧协作技能的保留)的评估,性能通过 CP 得分衡量。

实验结果

研究问题

  • RQ1在持续多智能体设置中训练的终身强化学习智能体,能否在未见过的、来自不同 MARL 方法的智能体上实现有效的零样本协作?
  • RQ2在真实、策略多样的基准上评估时,标准 LLL 算法在负向迁移和正向迁移方面的表现如何?
  • RQ3与在单个任务上训练相比,持续训练在多大程度上提升了在不同 MARL 方法之间的泛化能力?
  • RQ4架构和训练假设(如对称性、辅助任务、预训练)如何影响智能体在终身设置下的泛化能力?
  • RQ5在训练过程中遇到的伙伴智能体顺序是否会影响零样本设置下的最终协作表现?

主要发现

  • 在 Lifelong Hanabi 设置中训练的智能体在跨方法 CP 得分上表现出显著提升——表明其与未见过的智能体实现了更好的零样本协作——尽管其单次协作(SP)得分较低。
  • IQL+AUX+ER 方法在所有评估方法中取得了最佳的跨方法 CP 表现,甚至优于某些专用 MARL 算法在零样本协作中的表现。
  • 尽管 SOTA MARL 方法在同方法 CP 和 SP 上表现良好,但在跨方法 CP 上表现不佳,暴露出不同训练范式之间泛化能力的关键差距。
  • 使用 Adam 优化器的 MTL 和使用 SGD 优化器的 ER 在最终跨方法 CP 得分上达到最高,表明在持续学习下具备强大的泛化能力,尽管 MTL 需要同时访问所有伙伴,限制了其在现实场景中的适用性。
  • 该框架揭示了适应新伙伴与保留与旧伙伴协作技能之间存在明确权衡,凸显了终身多智能体学习中的稳定性-可塑性困境。
  • 研究表明,该设置下的持续训练无需集中式训练或额外假设,即可实现有效的零样本协作,验证了该基准的真实性和实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。