Skip to main content
QUICK REVIEW

[论文解读] MADiff: Offline Multi-agent Learning with Diffusion Models

Zhengbang Zhu, Minghuan Liu|arXiv (Cornell University)|May 27, 2023
Opinion Dynamics and Social Influence被引用 5
一句话总结

MADiff 提出首个基于扩散模型的离线多智能体强化学习框架,采用基于注意力的扩散模型,联合生成多个智能体的协调轨迹,实现去中心化执行与内置队友建模的集中式控制。通过在去噪步骤中利用潜在空间中的跨智能体注意力机制建模智能体间依赖关系,该方法在多种多智能体任务中实现了最先进性能。

ABSTRACT

Offline reinforcement learning (RL) aims to learn policies from pre-existing datasets without further interactions, making it a challenging task. Q-learning algorithms struggle with extrapolation errors in offline settings, while supervised learning methods are constrained by model expressiveness. Recently, diffusion models (DMs) have shown promise in overcoming these limitations in single-agent learning, but their application in multi-agent scenarios remains unclear. Generating trajectories for each agent with independent DMs may impede coordination, while concatenating all agents' information can lead to low sample efficiency. Accordingly, we propose MADiff, which is realized with an attention-based diffusion model to model the complex coordination among behaviors of multiple agents. To our knowledge, MADiff is the first diffusion-based multi-agent learning framework, functioning as both a decentralized policy and a centralized controller. During decentralized executions, MADiff simultaneously performs teammate modeling, and the centralized controller can also be applied in multi-agent trajectory predictions. Our experiments demonstrate that MADiff outperforms baseline algorithms across various multi-agent learning tasks, highlighting its effectiveness in modeling complex multi-agent interactions. Our code is available at https://github.com/zbzhu99/madiff.

研究动机与目标

  • 为解决离线多智能体强化学习中因缺乏协调而导致独立策略学习产生不一致行为的挑战。
  • 开发一种统一框架,既能作为去中心化策略,也能作为多智能体轨迹生成的集中式控制器。
  • 通过利用扩散模型的生成能力,在不增加额外推理成本的前提下实现有效的队友建模。
  • 通过将多智能体学习建模为返回值条件化的轨迹生成,克服离线强化学习中的外推误差。
  • 展示注意力机制在潜在空间中对智能体之间复杂、长距离交互关系建模的有效性。

提出的方法

  • MADiff 使用以期望回报为条件的扩散模型生成多智能体轨迹,将问题视为条件生成建模任务。
  • 引入一种在智能体间潜在嵌入上运行的注意力机制,使智能体在每个去噪步骤中实现信息交换与协调。
  • 模型在包含联合轨迹和回报标签的离线数据集上以集中方式训练,从专家演示中捕捉协调行为。
  • 推理阶段采用无分类器指导与低温采样生成高回报轨迹,实现去中心化执行并预测队友行为。
  • 该框架支持去中心化策略推理与集中式轨迹预测,统一了多种角色于同一架构中。
  • 探索了智能体间参数共享,以降低模型复杂度,同时保持性能。

实验结果

研究问题

  • RQ1扩散模型是否能在无需在线交互的情况下,有效协调离线多智能体强化学习中的多智能体行为?
  • RQ2潜在空间中的注意力机制在轨迹生成过程中如何提升智能体间的协调性?
  • RQ3与现有离线 MARL 基线相比,该框架在协调性和回报最大化方面有多大程度的性能提升?
  • RQ4同一模型是否能同时作为去中心化策略和内置队友建模的集中式控制器?
  • RQ5在高数据混淆和复杂协调任务下,模型表现如何?

主要发现

  • MADiff 在一系列多智能体学习任务中显著优于基线算法,包括离线强化学习和轨迹预测。
  • 消融实验确认,智能体间注意力对协调至关重要,MADiff-D 相较于独立扩散模型表现大幅提升,尤其在 'World' 等复杂任务中。
  • 智能体间计划轨迹的一致性比率随时间推移持续提升,并超过真实回放的一致性水平,表明实现了有效的队友建模及预测的动态修正。
  • 即使在高混淆设置下,模型仍表现出色,证明其对数据混淆和复杂协调需求具有鲁棒性。
  • U-Net 主干网络中的参数共享未降低性能,反而减小了模型规模,使 MADiff-D-Share 成为首选默认配置。
  • 可视化结果表明,MADiff 在回放过程中能动态修正不一致的队友轨迹预测,从而生成全局一致的行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。