Skip to main content
QUICK REVIEW

[论文解读] Attention Actor-Critic algorithm for Multi-Agent Constrained Co-operative Reinforcement Learning

P. Parnika, Raghuram Bharadwaj Diddigi|arXiv (Cornell University)|Jan 7, 2021
Reinforcement Learning in Robotics被引用 5
一句话总结

该论文提出MACAAC,一种基于注意力机制的Actor-Critic算法,用于多智能体约束合作强化学习,通过自适应拉格朗日对偶参数,使智能体在学习最优策略的同时满足动作约束。通过为策略学习和约束满足分别设计独立的注意力机制,MACAAC使智能体能够动态优先处理相关信息,在Cooperative Navigation和Treasure Collection等基准环境中的表现优于固定权重基线方法,同时满足惩罚约束。

ABSTRACT

In this work, we consider the problem of computing optimal actions for Reinforcement Learning (RL) agents in a co-operative setting, where the objective is to optimize a common goal. However, in many real-life applications, in addition to optimizing the goal, the agents are required to satisfy certain constraints specified on their actions. Under this setting, the objective of the agents is to not only learn the actions that optimize the common objective but also meet the specified constraints. In recent times, the Actor-Critic algorithm with an attention mechanism has been successfully applied to obtain optimal actions for RL agents in multi-agent environments. In this work, we extend this algorithm to the constrained multi-agent RL setting. The idea here is that optimizing the common goal and satisfying the constraints may require different modes of attention. By incorporating different attention modes, the agents can select useful information required for optimizing the objective and satisfying the constraints separately, thereby yielding better actions. Through experiments on benchmark multi-agent environments, we show the effectiveness of our proposed algorithm.

研究动机与目标

  • 解决在必须同时满足动作约束的前提下训练合作多智能体强化学习智能体的挑战。
  • 克服固定权重惩罚方法的局限性,即最优约束权重事先未知,需通过试错学习。
  • 将注意力机制整合到Actor-Critic框架中,使智能体能够为策略优化和约束满足分别选择性关注相关信息。
  • 通过双时间尺度学习方法实现集中式训练与分布式执行,其中策略参数更新速度快于拉格朗日对偶参数。
  • 通过实证验证,所提方法在多智能体环境中能实现接近最优的性能,同时满足指定的惩罚约束。

提出的方法

  • 该方法采用具有双注意力头的集中式评论家:一个用于主成本(策略优化),一个用于惩罚成本(约束满足)。
  • 采用双时间尺度学习算法:策略参数在快速时间尺度上更新,而拉格朗日对偶参数(约束权重)在较慢时间尺度上更新。
  • 注意力机制使每个智能体能够为其他智能体的观测动态分配不同的注意力权重,从而为不同子任务实现选择性信息处理。
  • 拉格朗日公式结合主成本与约束成本,通过对偶参数通过梯度上升学习,以强制执行约束,而无需事先知道最优权重。
  • 该算法在两个基准环境上进行评估:Cooperative Navigation(一个约束)和Treasure Collection(两个约束),采用稀疏奖励和碰撞惩罚。
  • 该方法训练评论家以估计主目标和惩罚项的Q值,通过在值函数估计中应用注意力机制,提升表征学习效果。

实验结果

研究问题

  • RQ1基于注意力机制的Actor-Critic算法能否在多智能体环境中有效学习合作策略,同时满足指定的动作约束?
  • RQ2将策略学习与约束满足的注意力机制解耦,是否能带来优于共享注意力或固定权重惩罚方法的性能?
  • RQ3在多智能体设置中,能否有效学习自适应的拉格朗日对偶参数,以自动平衡目标优化与约束执行?
  • RQ4注意力机制在训练过程中如何演化?是否使智能体能够为不同任务动态优先关注相关队友?
  • RQ5所提方法在约束满足与目标性能两方面是否均优于固定权重惩罚基线?

主要发现

  • MACAAC在Cooperative Navigation和Treasure Collection环境中均成功满足了所有指定的惩罚约束,约束违规始终低于阈值。
  • 在Cooperative Navigation环境中,固定权重基线在拉格朗日参数收敛后(w₁ = 5.534)满足了约束α = 3,但平均成本略高于MACAAC。
  • 在Treasure Collection环境中,固定权重基线在w₁ = 3.47和w₂ = 0.83时满足了两个约束,但平均成本高于MACAAC,表明固定权重可能过于严格。
  • MACAAC通过在训练过程中自适应学习拉格朗日参数,实现了更好的目标优化与约束满足之间的权衡,证明了双时间尺度方法的优势。
  • 注意力可视化显示,训练末期,智能体1对所有其他智能体的注意力基本均等,而智能体8(投放者)更关注智能体7(收集者),表明其在碰撞避免任务中存在任务特定的注意力分配。
  • 智能体8的惩罚评论家对所有智能体的注意力分布均匀,反映出避免碰撞需要全局感知,证实了注意力在约束执行中的作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。