Skip to main content
QUICK REVIEW

[论文解读] Agent-Time Attention for Sparse Rewards Multi-Agent Reinforcement Learning

Jennifer She, Jayesh K. Gupta|arXiv (Cornell University)|Oct 31, 2022
Reinforcement Learning in Robotics被引用 4
一句话总结

本文提出了一种名为Agent-Time Attention(ATA)的神经网络模型,通过注意力机制联合建模跨智能体与时间的信用分配,实现多智能体强化学习中稀疏且延迟的全局奖励的再分配。在扩展的MiniGrid环境上,ATA在稀疏奖励设置下优于强基线模型,展现出在协作式多智能体强化学习设置中更优的信用分配与策略学习能力。

ABSTRACT

Sparse and delayed rewards pose a challenge to single agent reinforcement learning. This challenge is amplified in multi-agent reinforcement learning (MARL) where credit assignment of these rewards needs to happen not only across time, but also across agents. We propose Agent-Time Attention (ATA), a neural network model with auxiliary losses for redistributing sparse and delayed rewards in collaborative MARL. We provide a simple example that demonstrates how providing agents with their own local redistributed rewards and shared global redistributed rewards motivate different policies. We extend several MiniGrid environments, specifically MultiRoom and DoorKey, to the multi-agent sparse delayed rewards setting. We demonstrate that ATA outperforms various baselines on many instances of these environments. Source code of the experiments is available at https://github.com/jshe/agent-time-attention.

研究动机与目标

  • 为解决协作式多智能体强化学习(MARL)中跨时间和智能体的稀疏且延迟的奖励问题,其中信用分配极具挑战性。
  • 开发一种方法,将全局稀疏奖励重新分配为密集的本地奖励,供单个智能体使用,同时保持协作能力。
  • 在仅对现有强化学习算法进行最小修改的前提下,实现去中心化策略的有效训练,符合集中训练去中心化执行(CTDE)范式。
  • 在长时序且稀疏奖励的环境中评估模型,例如扩展的MiniGrid环境(MultiRoom、DoorKey)。

提出的方法

  • ATA使用基于Transformer的架构,对智能体特异性表示和时间表示进行注意力计算,以实现奖励再分配。
  • 通过辅助预测损失,模型同时学习预测全局团队奖励和个体智能体奖励。
  • 采用双监督策略:在中间时间步和最终时间步均预测奖励,以改善时间维度上的信用分配。
  • 通过全局损失与局部损失的组合进行奖励再分配训练,并通过消融实验评估各损失组件的重要性。
  • 该方法与标准策略梯度方法(如IPG和IAC)兼容,可无缝集成至现有MARL框架中,实现即插即用。
  • 通过消融实验比较LSTM与Transformer编码器,以及平均池化与注意力聚合方式对内部表示的影响。

实验结果

研究问题

  • RQ1在稀疏奖励多智能体环境中,联合建模跨智能体与时间的信用分配在多大程度上提升了学习性能?
  • RQ2在延迟奖励的MARL中,时间维度信用分配与智能体维度信用分配的相对贡献如何?
  • RQ3架构选择(如Transformer与LSTM、注意力与平均池化)如何影响奖励再分配模型的性能?
  • RQ4何种损失配置(全局/局部,中间时间步/最终时间步)能实现稀疏奖励MARL中的最优策略学习?
  • RQ5ATA能否在具有长时序和稀疏奖励的多样化多智能体环境中实现泛化?

主要发现

  • 在扩展的MiniGrid环境(稀疏奖励设置)中,ATA优于强基线模型,包括仅沿智能体轴或时间轴进行信用分配的方法。
  • 通过中间时间步的预测损失进行训练可显著提升性能,表明早期监督有助于改善时间维度上的信用分配。
  • Transformer架构在训练初期始终优于LSTM,表明其在信用分配任务中具有更优的序列建模能力。
  • 在低智能体数量设置下,简单的平均池化通常优于更复杂的注意力机制,可能归因于梯度稳定性。
  • 全局与局部预测损失的组合并未始终提升性能;在某些情况下,仅使用全局损失可获得最佳结果。
  • 无论是否使用奖励再分配,IAC的性能均表现欠佳,可能由于在稀疏奖励设置下价值函数信号较差,凸显了稳健价值学习的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。