[论文解读] Safe Multi-Agent Reinforcement Learning through Decentralized Multiple Control Barrier Functions
该论文通过集成多个控制屏障函数(CBFs)提出了一种去中心化的安全多智能体强化学习框架,以确保多智能体系统中的避碰。该方法在MADDPG基础上引入去中心化的CBFs(MADDPG-CBF),证明了理论上的安全保证,并在实验中表明,该方法实现了无碰撞学习并获得稳定的高奖励,而基线MADDPG则频繁发生碰撞。
Multi-Agent Reinforcement Learning (MARL) algorithms show amazing performance in simulation in recent years, but placing MARL in real-world applications may suffer safety problems. MARL with centralized shields was proposed and verified in safety games recently. However, centralized shielding approaches can be infeasible in several real-world multi-agent applications that involve non-cooperative agents or communication delay. Thus, we propose to combine MARL with decentralized Control Barrier Function (CBF) shields based on available local information. We establish a safe MARL framework with decentralized multiple CBFs and develop Multi-Agent Deep Deterministic Policy Gradient (MADDPG) to Multi-Agent Deep Deterministic Policy Gradient with decentralized multiple Control Barrier Functions (MADDPG-CBF). Based on a collision-avoidance problem that includes not only cooperative agents but obstacles, we demonstrate the construction of multiple CBFs with safety guarantees in theory. Experiments are conducted and experiment results verify that the proposed safe MARL framework can guarantee the safety of agents included in MARL.
研究动机与目标
- 解决现实世界中多智能体强化学习(MARL)应用中的安全问题,其中由于通信延迟或非合作智能体的存在,集中式屏蔽不可行。
- 基于本地信息,开发一种去中心化、可扩展的MARL安全机制,利用多个控制屏障函数(CBFs)。
- 将CBFs与深度确定性策略梯度方法结合,构建一种安全且样本高效的MARL算法。
- 从理论和实证两方面验证所提框架在合作智能体与障碍物共存的多智能体环境中确保安全的能力。
提出的方法
- 提出一种基于去中心化多CBF的安全MARL框架,每个智能体根据本地观测同时使用合作与非合作CBFs。
- 通过二次规划(QPs)推导控制律,对动作进行修改以满足CBF约束,确保安全集的前向不变性。
- 基于相对位置与速度,设计用于智能体间交互的合作CBFs,以及用于障碍物的非合作CBFs。
- 将CBF屏蔽机制集成到MADDPG算法中,形成MADDPG-CBF,在保持策略优化的同时强制执行安全约束。
- 采用混合奖励函数,对靠近障碍物和其他智能体的行为进行惩罚,同时为抵达目标检查点提供额外激励。
- 采用两阶段动作修正:首先由原始策略生成动作;其次,CBFs通过QP优化将这些动作投影到安全集中。
实验结果
研究问题
- RQ1去中心化的多CBF是否能在不依赖集中式屏蔽或全局通信的情况下确保MARL中的安全性?
- RQ2如何协同设计合作与非合作CBFs,以同时处理智能体间与智能体与障碍物之间的碰撞?
- RQ3将CBFs与MADDPG结合是否能在保证训练期间安全性的前提下,保持学习性能?
- RQ4所提框架在多智能体避碰场景中具有怎样的理论安全保证?
- RQ5MADDPG-CBF在碰撞频率与累积奖励方面相较于标准MADDPG表现如何?
主要发现
- MADDPG-CBF从训练开始即实现了约40,000的稳定平均总奖励,而标准MADDPG则需3,200个训练回合才收敛。
- MADDPG-CBF在全部25,000个训练回合中碰撞比率为0%,在五次独立运行中均未记录到任何碰撞。
- 相比之下,标准MADDPG在同一训练运行中发生了12,634次碰撞,碰撞比率为50.536%。
- 轨迹可视化结果表明,MADDPG-CBF中的智能体通过协调转向成功避免了彼此及障碍物的碰撞。
- 该方法使Patrolman II成功抵达全部五个检查点,同时保持了安全性,证明了在严格安全约束下完成任务的能力。
- CBF的集成显著提升了样本效率与安全性,在学习过程中未观察到任何安全违规事件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。