Skip to main content
QUICK REVIEW

[论文解读] ELIGN: Expectation Alignment as a Multi-Agent Intrinsic Reward

Zixian Ma, Rose Wang|arXiv (Cornell University)|Oct 9, 2022
Mosquito-borne diseases and control被引用 6
一句话总结

本文提出ELIGN,一种基于期望对齐的、与任务无关的内在奖励机制,可在去中心化训练和稀疏奖励设置下实现多智能体强化学习。受动物群体自组织行为的启发,ELIGN促使智能体以匹配其邻近智能体预测的方式行动,从而在无需集中式训练或密集奖励的情况下提升协作性能,并在多智能体粒子环境和Google Research足球环境中实现了最先进性能,尤其在部分可观测性条件下表现优异。

ABSTRACT

Modern multi-agent reinforcement learning frameworks rely on centralized training and reward shaping to perform well. However, centralized training and dense rewards are not readily available in the real world. Current multi-agent algorithms struggle to learn in the alternative setup of decentralized training or sparse rewards. To address these issues, we propose a self-supervised intrinsic reward ELIGN - expectation alignment - inspired by the self-organization principle in Zoology. Similar to how animals collaborate in a decentralized manner with those in their vicinity, agents trained with expectation alignment learn behaviors that match their neighbors' expectations. This allows the agents to learn collaborative behaviors without any external reward or centralized training. We demonstrate the efficacy of our approach across 6 tasks in the multi-agent particle and the complex Google Research football environments, comparing ELIGN to sparse and curiosity-based intrinsic rewards. When the number of agents increases, ELIGN scales well in all multi-agent tasks except for one where agents have different capabilities. We show that agent coordination improves through expectation alignment because agents learn to divide tasks amongst themselves, break coordination symmetries, and confuse adversaries. These results identify tasks where expectation alignment is a more useful strategy than curiosity-driven exploration for multi-agent coordination, enabling agents to do zero-shot coordination.

研究动机与目标

  • 解决在缺乏集中式评论家和密集奖励设计的情况下,去中心化训练与稀疏奖励下的多智能体协作挑战。
  • 开发一种与任务无关的内在奖励,使智能体能够在无外部监督或完全可观测性的情况下学习协作行为。
  • 通过使智能体行为与队友的期望保持一致来改善协作,减少误协调和对称性破缺问题。
  • 在复杂环境中实现零样本协作与可扩展性,尤其适用于具备多样化能力的智能体。
  • 在去中心化、部分可观测设置下,超越现有的内在奖励(如好奇心)和稀疏奖励方法。

提出的方法

  • ELIGN基于智能体的动作与其邻近智能体对其未来观测的预测之间的一致性,计算内在奖励。
  • 每个智能体基于局部观测和世界模型,预测其邻近智能体的未来观测,形成用于期望建模的‘预测头’。
  • 内在奖励为预测与实际未来观测之间均方误差的负值,激励智能体采取能减少队友预测不确定性的行为。
  • 该方法基于动物行为学中的自组织原理,采用自监督学习目标,使智能体通过局部预测对齐实现协作。
  • 方法基于SAC的多智能体强化学习框架实现,采用共享世界模型和独立策略网络,以端到端方式实现去中心化训练。
  • 评估了三种变体:self-ELIGN(智能体预测自身未来)、team-ELIGN(智能体预测队友未来)和adv-ELIGN(智能体预测对手未来),并进行了消融实验分析性能。

实验结果

研究问题

  • RQ1期望对齐能否作为去中心化训练与稀疏奖励设置下多智能体强化学习的可行内在奖励?
  • RQ2ELIGN是否能在无集中式评论家或密集奖励设计的情况下提升多智能体任务的协作性能?
  • RQ3在多样化环境中,ELIGN与基于好奇心和稀疏内在奖励的方法相比,在可扩展性与性能方面表现如何?
  • RQ4在何种场景下,期望对齐相较于基于好奇心的探索在协作方面更具优势?
  • RQ5在规模扩大或未见过的配置下,基于ELIGN训练的智能体是否能实现零样本协作?

主要发现

  • 在多智能体粒子环境和Google Research足球环境的6项任务中,ELIGN在5项任务中优于稀疏奖励和基于好奇心的内在奖励,尤其在部分可观测性和去中心化训练条件下表现突出。
  • 在5个智能体的协作导航任务中,ELIGN(self-variant)实现了平均外在奖励471.07 ± 5.00,显著优于稀疏基线的434.68 ± 6.42。
  • 在6个智能体的异构导航任务中,ELIGN(team-variant)实现了699.56 ± 11.64,远超稀疏基线的561.16 ± 31.63。
  • 在物理欺骗任务中,ELIGN(self-variant)实现了248.16 ± 6.62,而稀疏基线仅为128.64 ± 17.31,表明在对抗性环境中协作能力显著提升。
  • 在捕食者-猎物和守卫任务中,ELIGN降低了智能体与对手之间的距离,并提升了协作效率,其中team-ELIGN变体在捕食者-猎物任务中实现2.04 ± 0.01,优于稀疏基线的1.93 ± 0.00。
  • ELIGN展现出强大的零样本泛化能力:基于ELIGN训练的智能体在规模扩大的环境中性能优于稀疏奖励或基于好奇心的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。