Skip to main content
QUICK REVIEW

[论文解读] Multi-Agent Reinforcement Learning Guided by Signal Temporal Logic Specifications

Jiangwei Wang, Shuo Yang|arXiv (Cornell University)|Jun 11, 2023
Formal Methods in Verification被引用 5
一句话总结

该论文提出了一种由信号时序逻辑(STL)规范引导的新型多智能体强化学习(MARL)框架,以解决多智能体系统中具有挑战性的奖励设计与安全需求问题。通过利用STL鲁棒性值作为密集且可解释的奖励,并通过STL安全防护机制强制执行硬性安全约束,该方法在诸如交通拥堵导航等复杂场景中,相较于基线MARL算法,显著提升了学习性能与安全率。

ABSTRACT

Reward design is a key component of deep reinforcement learning, yet some tasks and designer's objectives may be unnatural to define as a scalar cost function. Among the various techniques, formal methods integrated with DRL have garnered considerable attention due to their expressiveness and flexibility to define the reward and requirements for different states and actions of the agent. However, how to leverage Signal Temporal Logic (STL) to guide multi-agent reinforcement learning reward design remains unexplored. Complex interactions, heterogeneous goals and critical safety requirements in multi-agent systems make this problem even more challenging. In this paper, we propose a novel STL-guided multi-agent reinforcement learning framework. The STL requirements are designed to include both task specifications according to the objective of each agent and safety specifications, and the robustness values of the STL specifications are leveraged to generate rewards. We validate the advantages of our method through empirical studies. The experimental results demonstrate significant reward performance improvements compared to MARL without STL guidance, along with a remarkable increase in the overall safety rate of the multi-agent systems.

研究动机与目标

  • 解决在具有异质性目标和安全关键约束的多智能体强化学习(MARL)中设计有效且可解释的奖励函数的挑战。
  • 探索信号时序逻辑(STL)在MARL中表达任务目标与安全需求的可行性。
  • 开发一种利用STL鲁棒性作为密集且可解释的奖励信号以指导策略学习的方法。
  • 通过基于STL的安全防护机制,在训练和推理过程中确保硬性安全约束的满足。
  • 在复杂的真实世界类环境中(如CARLA和MPE)验证所提出框架的有效性。

提出的方法

  • 该框架使用信号时序逻辑(STL)对多智能体系统中每个智能体的任务目标与安全约束进行形式化规范。
  • 在部分轨迹上计算STL鲁棒性值,并将其用作训练期间的密集连续奖励信号,以指导策略优化。
  • 集成STL安全防护机制,通过修改动作以确保关键安全规范的满足,从而强制执行硬性安全约束。
  • 该方法使用主流MARL算法(如MAPPO、MAA2C)实现,结合STL引导的奖励设计与安全约束强制执行。
  • 该方法在两个环境中进行评估:多智能体粒子世界(MPE)和自动驾驶场景的CARLA模拟器。
  • 该框架通过在不同智能体交互模式下保持一致的性能,支持混合的合作-竞争交互。

实验结果

研究问题

  • RQ1STL鲁棒性值是否能有效引导MARL训练,以提升策略性能与安全性?
  • RQ2与手工设计的标量奖励相比,STL引导的奖励设计在学习效率与安全性方面表现如何?
  • RQ3STL安全防护机制在多智能体系统中在多大程度上能确保硬性安全约束的满足?
  • RQ4所提出的框架在MARL中不同交互模式(如合作与竞争)之间是否具备泛化能力?
  • RQ5STL规范是否能够捕捉真实世界场景(如自动驾驶车辆导航)中的复杂时空需求?

主要发现

  • 在Traffic-jam场景中,STL引导的MARL在Agent 1上实现了1469.98 ± 43.87的平均回合回报,Agent 2为3577.53 ± 580.04,Agent 3为3699.26 ± 588.62,显著优于MAPPO(1244.12 ± 174.18,1838.96 ± 392.22,2245.07 ± 150.75)和MAA2C(1131.51 ± 389.62,1645.80 ± 693.49,2713.19 ± 465.45)。
  • 在Traffic-jam场景中,STL引导的MARL安全率达到97%,显著高于MAPPO(74%)、MAA2C(88%)以及未使用STL安全防护的MAPPO(65%)。
  • 在Traffic-jam Expansion场景中,STL引导的MARL实现了31,828.34 ± 2,772.05的总平均回合回报与90%的安全率,优于MAPPO(27,617.27 ± 9,504.04,64%)和MAA2C(24,169.17 ± 4,133.64,68%)。
  • 在扩展场景中,MAPPO若缺少STL安全防护,安全率骤降至20%,凸显了安全防护机制在维持系统安全性方面的重要作用。
  • 所提出方法在合作与竞争交互模式下均持续优于基线方法,证明了其在混合环境中的鲁棒性。
  • CARLA中的可视化结果表明,STL引导的智能体成功穿越开放车道而未发生碰撞,而基线智能体则失败并发生碰撞。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。