Skip to main content
QUICK REVIEW

[论文解读] Learning to Ground Multi-Agent Communication with Autoencoders

Toru Lin, Minyoung Huh|arXiv (Cornell University)|Oct 28, 2021
Speech and dialogue systems被引用 16
一句话总结

本文提出了一种去中心化的多智能体强化学习框架,通过自编码机制将通信与学习到的视觉表征相联系,使智能体能够在无监督条件下发展出一种共享且可解释的语言。通过训练智能体利用自编码器重建其观测,该方法在通信中诱导出内在的一致性,显著提升了在各类任务中的协调能力——在FindGoal、RedBlueDoors等环境中,平均奖励最高达到基线方法的2.5倍。

ABSTRACT

Communication requires having a common language, a lingua franca, between agents. This language could emerge via a consensus process, but it may require many generations of trial and error. Alternatively, the lingua franca can be given by the environment, where agents ground their language in representations of the observed world. We demonstrate a simple way to ground language in learned representations, which facilitates decentralized multi-agent communication and coordination. We find that a standard representation learning algorithm -- autoencoding -- is sufficient for arriving at a grounded common language. When agents broadcast these representations, they learn to understand and respond to each other's utterances and achieve surprisingly strong task performance across a variety of multi-agent communication environments.

研究动机与目标

  • 为解决去中心化多智能体强化学习中的涌现通信挑战,其中智能体缺乏共享语言,且面临稀疏奖励与高方差问题。
  • 克服通信符号缺乏基础的问题,该问题阻碍了零样本设置下协议的稳定涌现。
  • 探究通过自编码进行表征学习是否可作为通用的无监督机制,将语言与环境基础化,从而实现有效通信。
  • 证明简单的自编码目标可诱导出完全去中心化的MARL设置中积极的信号传递与协调行为。
  • 提供一种可扩展的、与架构无关的通信基础化框架,无需可微分通信或共享策略参数。

提出的方法

  • 智能体通过结合环境强化学习与观测自编码目标的多任务损失进行训练。
  • 每个智能体学习使用共享编码器架构重建自身观测,从而在智能体之间建立共同的表征空间。
  • 自编码损失作为监督信号,对齐智能体的内部表征,使其能够理解彼此的消息。
  • 通信通过基于学习表征的非可微分离散消息广播实现,支持去中心化策略优化。
  • 该框架在多个MARL环境中(包括FindGoal、RedBlueDoors和CoinGame)直接应用,无需架构或任务特定的修改。
  • 通过策略熵与奖励曲线分析协调行为的涌现,以及通信在降低不确定性中的作用。

实验结果

研究问题

  • RQ1简单的自编码目标能否作为去中心化多智能体系统中涌现通信的通用基础机制?
  • RQ2在零样本、非可微分通信设置下,将通信建立在共享表征上是否能提升协调性与任务表现?
  • RQ3与有监督、集中式或可微分通信基线相比,基于自编码的通信框架在样本效率与最终性能方面表现如何?
  • RQ4自编码器诱导的表征学习在多大程度上促进了积极信号(即影响行为的消息)而非随机噪声?
  • RQ5该方法是否能在无需架构或任务特定调整的情况下,泛化到多样化的多智能体协调任务中?

主要发现

  • 所提出的基于自编码的通信框架在FindGoal与RedBlueDoors任务中显著优于有监督、集中式及可微分通信基线,平均奖励最高提升2.5倍。
  • ae-comm智能体的策略熵随时间下降,表明不确定性减少,行为更加一致,尤其在通信存在时表现明显。
  • 增加通信通道显著提升了平均奖励——证明了有效积极信号的产生,尤其在ae-comm智能体中表现突出。
  • 通过自编码训练的智能体学习到可解释且有助于协调的表征广播,即使在无共享策略参数或可微梯度的情况下亦然。
  • 该方法在以往被认为几乎无法在无通信条件下解决的任务中实现了优异性能,凸显了视觉基础在涌现语言中的关键作用。
  • 该框架在多种环境中表现出鲁棒性,且无需对输入结构或任务类型做假设,展现出广泛的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。