Skip to main content
QUICK REVIEW

[论文解读] Safe Deep Reinforcement Learning for Multi-Agent Systems with Continuous Action Spaces

Ziyad Sheebaelhamd, Konstantinos Zisis|arXiv (Cornell University)|Aug 9, 2021
Reinforcement Learning in Robotics参考文献 19被引用 10
一句话总结

该论文通过在MADDPG框架中引入软约束安全层,将Safe DDPG扩展至具有连续动作空间的多智能体深度强化学习。通过将安全投影重新表述为惩罚优化问题,该方法在不安全条件下将约束违反减少了97.7%,并确保了递归可行性,从而实现了无需备用策略的安全训练。

ABSTRACT

Multi-agent control problems constitute an interesting area of application for deep reinforcement learning models with continuous action spaces. Such real-world applications, however, typically come with critical safety constraints that must not be violated. In order to ensure safety, we enhance the well-known multi-agent deep deterministic policy gradient (MADDPG) framework by adding a safety layer to the deep policy network. In particular, we extend the idea of linearizing the single-step transition dynamics, as was done for single-agent systems in Safe DDPG (Dalal et al., 2018), to multi-agent settings. We additionally propose to circumvent infeasibility problems in the action correction step using soft constraints (Kerrigan & Maciejowski, 2000). Results from the theory of exact penalty functions can be used to guarantee constraint satisfaction of the soft constraints under mild assumptions. We empirically find that the soft formulation achieves a dramatic decrease in constraint violations, making safety available even during the learning procedure.

研究动机与目标

  • 解决具有连续动作空间的多智能体深度强化学习中的安全约束问题,其中硬约束可能导致不可行的动作修正。
  • 在克服硬约束优化中递归不可行性的局限性的同时,将Safe DDPG扩展至多智能体环境。
  • 通过确保安全过滤器在约束紧密或冲突时仍能持续运行,提升在不安全初始化和外部扰动下的训练鲁棒性。
  • 通过软约束公式,在最小化约束违反的同时保持有效的学习性能。
  • 通过使安全过滤器即使在约束紧密或冲突时也能运行,消除对备用控制器的依赖。

提出的方法

  • 将安全层集成到MADDPG框架中,基于线性化约束函数的二次规划将动作投影到安全集合上。
  • 在动作空间中对约束应用一阶泰勒近似,其参数由基于历史数据训练的神经网络表示。
  • 通过使用精确罚函数,将硬约束优化重新表述为软约束问题,以允许受控的约束违反并施加惩罚。
  • 采用由Kerrigan & Maciejowski(2000)提出的容差裕量方法实现软约束,以确保递归可行性。
  • 利用精确罚函数理论,在适当调整惩罚参数的前提下,于弱假设下保证约束满足。
  • 通过将安全层嵌入策略网络,保持端到端可微性与离策略深度强化学习训练的兼容性。

实验结果

研究问题

  • RQ1Safe DDPG框架能否成功扩展至具有连续动作空间的多智能体系统?
  • RQ2与硬约束相比,软约束是否在多智能体设置中提升了递归可行性并减少了约束违反?
  • RQ3在不安全初始化或扰动存在的情况下,软约束安全层如何影响学习性能与收敛性?
  • RQ4安全过滤器是否能在无需独立备用控制器的情况下于训练期间保持活跃?
  • RQ5软约束公式在确保安全的同时,能在多大程度上维持任务性能?

主要发现

  • 在不安全初始化(UI)条件下,软MADDPG相比无约束MADDPG将碰撞减少了97.71%,而硬MADDPG仅实现84.38%的减少。
  • 在外部扰动(ED)条件下,软MADDPG将碰撞减少了97.99%,而硬MADDPG仅减少42.42%。
  • 在ED条件下,硬约束公式在56.7%的回合中遭遇不可行性,在UI条件下为20.9%,严重限制了其实际应用。
  • 在测试仿真中,软MADDPG在UI和ED设置下均实现了最低的累积碰撞数,展现出更优的安全鲁棒性。
  • 软约束方法在学习趋势和最终回报方面与无约束MADDPG保持相似,表明对任务性能无负面影响。
  • 在训练期间,约束违反被显著减少,软MADDPG在ED情况下仅达到基线碰撞数的2.0%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。