Skip to main content
QUICK REVIEW

[论文解读] Multi-agent Deep Reinforcement Learning with Extremely Noisy Observations

Ozsel Kilinc, Giovanni Montana|arXiv (Cornell University)|Dec 3, 2018
Reinforcement Learning in Robotics参考文献 21被引用 21
一句话总结

该论文提出MADDPG-M,一种多智能体深度强化学习算法,能够在极端噪声、部分观测条件下同步学习最优策略与通信策略。通过整合两级学习机制、内在生成奖励与分层策略学习,该方法使智能体能够选择性地共享信息丰富的观测,在复杂非平稳环境中实现与基准最优解(oracle baseline)相当的性能,最严峻场景下通信准确率达88.82%。

ABSTRACT

Multi-agent reinforcement learning systems aim to provide interacting agents with the ability to collaboratively learn and adapt to the behaviour of other agents. In many real-world applications, the agents can only acquire a partial view of the world. Here we consider a setting whereby most agents' observations are also extremely noisy, hence only weakly correlated to the true state of the environment. Under these circumstances, learning an optimal policy becomes particularly challenging, even in the unrealistic case that an agent's policy can be made conditional upon all other agents' observations. To overcome these difficulties, we propose a multi-agent deep deterministic policy gradient algorithm enhanced by a communication medium (MADDPG-M), which implements a two-level, concurrent learning mechanism. An agent's policy depends on its own private observations as well as those explicitly shared by others through a communication medium. At any given point in time, an agent must decide whether its private observations are sufficiently informative to be shared with others. However, our environments provide no explicit feedback informing an agent whether a communication action is beneficial, rather the communication policies must also be learned through experience concurrently to the main policies. Our experimental results demonstrate that the algorithm performs well in six highly non-stationary environments of progressively higher complexity, and offers substantial performance gains compared to the baselines.

研究动机与目标

  • 解决在极端观测噪声下多智能体强化学习的挑战,此时智能体仅能获得环境的弱相关、部分视图。
  • 使智能体在无显式反馈的情况下学习何时以及如何通信,仅依赖奖励信号。
  • 开发一种并发学习框架,联合优化非平稳、部分可观察环境下的动作策略与通信策略。
  • 克服独立训练与基线方法在高噪声与高复杂度下失效的局限性。
  • 证明通过学习通信实现的智能信息过滤,是噪声环境中协作多智能体系统任务成功的关键。

提出的方法

  • 该方法在MADDPG框架基础上引入通信媒介,使智能体能够共享观测,基于私有与共享信息实现联合策略学习。
  • 采用双策略架构:一个用于动作(μ),另一个用于通信决策(ν),两者均通过深度确定性策略梯度并发训练。
  • 使用内在生成奖励引导通信策略学习,提供关于共享观测是否改善未来结果的反馈。
  • 在学习过程的不同层级应用时间抽象,以处理动作与通信决策之间的分层依赖关系。
  • 通信策略学习过滤噪声观测,仅共享具有信息量且可能提升集体表现的内容。
  • 框架采用集中式训练、去中心化执行(CTDE)范式,训练时可完全访问所有智能体的观测,测试时保持去中心化。

实验结果

研究问题

  • RQ1当缺乏对通信质量的显式反馈时,多智能体强化学习是否能在观测极端噪声、信息部分的环境中取得成功?
  • RQ2与独立训练或固定通信基线相比,并发学习动作策略与通信策略在性能上有多大的提升?
  • RQ3在高噪声与非平稳条件下,智能体在多大程度上能学习过滤并选择性共享观测以提升集体任务表现?
  • RQ4通信准确率对任务成功的影响如何?智能体能否在无监督条件下实现接近最优的通信行为?
  • RQ5环境复杂度(如动态与静态、广播与单播)如何影响有效通信策略的学习?

主要发现

  • MADDPG-M在全部六个环境中均达到与基准最优解DDPG-OC相当的性能,包括最复杂的动态与单播场景。
  • 在最具挑战性的广播场景中,MADDPG-M有88.82%的时间选择了最优通信动作,足以完成任务。
  • 在动态单播场景中,尽管整体最优通信模式识别准确率仅为28.98%,但由于个体通信动作准确率达64.23%,智能体仍成功完成任务。
  • IQL与Meta-agent等基线方法因噪声观测导致奖励信号退化,在复杂或动态环境中无法学习合理行为。
  • 该算法对环境复杂度增加表现出鲁棒性,性能稳定,而基线方法在复杂场景中迅速崩溃,尤其在碰撞与协调需求更高的单播设置中表现更明显。
  • 内在生成奖励的使用使智能体在通信策略完全优化前即能早期学习环境动态,形成动作与通信学习之间的正向反馈循环。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。