Skip to main content
QUICK REVIEW

[论文解读] CoDe: A Cooperative and Decentralized Collision Avoidance Algorithm for Small-Scale UAV Swarms Considering Energy Efficiency

Shuangyao Huang, Haibo Zhang|arXiv (Cornell University)|Apr 19, 2022
Adversarial Robustness in Machine Learning被引用 5
一句话总结

本文提出MACA,一种用于小型无人机蜂群的协作式、去中心化多智能体强化学习算法,联合优化避障与能效。通过采用新型反事实信用分配机制的集中式评论家网络,针对连续动作空间,MACA相较传统方法(如E²Coop)实现16%更高的平均奖励、90%更低的失败率,且响应速度提升超过99%。

ABSTRACT

This paper introduces a cooperative and decentralized collision avoidance algorithm (CoDe) for small-scale UAV swarms consisting of up to three UAVs. CoDe improves energy efficiency of UAVs by achieving effective cooperation among UAVs. Moreover, CoDe is specifically tailored for UAV's operations by addressing the challenges faced by existing schemes, such as ineffectiveness in selecting actions from continuous action spaces and high computational complexity. CoDe is based on Multi-Agent Reinforcement Learning (MARL), and finds cooperative policies by incorporating a novel credit assignment scheme. The novel credit assignment scheme estimates the contribution of an individual by subtracting a baseline from the joint action value for the swarm. The credit assignment scheme in CoDe outperforms other benchmarks as the baseline takes into account not only the importance of a UAV's action but also the interrelation between UAVs. Furthermore, extensive experiments are conducted against existing MARL-based and conventional heuristic-based algorithms to demonstrate the advantages of the proposed algorithm.

研究动机与目标

  • 解决计算与通信资源有限的小型无人机蜂群在协作、能效避障方面的挑战。
  • 克服多智能体强化学习(MARL)中集中训练、去中心化执行(CTDE)在连续动作空间下的信用分配问题。
  • 设计一种低复杂度、可扩展的方法,实现实时、去中心化的决策,同时最大化全局安全性和能效。
  • 减少对集中式规划或高带宽无人机间通信的依赖,这些在资源受限的无人机中不切实际。
  • 在不依赖采样或近似的情况下,改进现有MARL算法(如COMA和Shapley),实现对连续动作空间的直接应用。

提出的方法

  • 将无人机蜂群避障建模为去中心化的部分可观察马尔可夫决策过程(Dec-POMDP),并将安全性和能效整合到全局奖励函数中。
  • 实施多智能体演员-集中式评论家框架(MACA),其中共享的评论家网络利用联合观测与动作计算全局回报。
  • 设计一种反事实基线,通过边缘化单个智能体的状态与动作,计算连续动作空间中低复杂度的优势函数,以实现信用分配。
  • 通过评论家网络的前向传播计算优势函数,避免COMA与Shapley中使用的昂贵采样或近似方法。
  • 集成一种应急避障机制,以处理去中心化执行过程中的罕见故障情况,提升鲁棒性。
  • 开发专用仿真环境MACAEnv,用于建模真实的无人机动力学、障碍物交互关系及通信约束,以支持训练与评估。

实验结果

研究问题

  • RQ1在连续动作空间中,结合反事实信用分配机制的集中式评论家能否有效训练去中心化策略,实现无人机蜂群避障?
  • RQ2在动态无人机蜂群场景中,所提出的信用分配方法相较于COMA与Shapley,在学习效率、失败率与响应时间方面表现如何?
  • RQ3在奖励函数中引入能效因素,能在多大程度上提升无人机蜂群的长期性能与运行可持续性?
  • RQ4与传统及最先进MARL方法相比,所提算法在不同蜂群规模与障碍物密度下的表现如何?
  • RQ5应急避障机制是否能显著降低去中心化执行中的失败率,同时不损害响应时间或能效?

主要发现

  • 在2U1O、3U1O与4U2O配置下,MACA的平均奖励分别较两种最先进MARL算法高出16.61%、20.41%与19.22%。
  • 在4U2O场景中,MACA的失败率相比传统E²Coop算法降低90%,从20%降至2%。
  • 在所有测试场景中,MACA的响应时间相比E²Coop减少超过99%,通过演员网络的一次前向传播即可实现近乎即时的决策。
  • MACA在所有场景中的失败率均低于MACA(noEAS),在3U1O场景中失败率为0%,在4U2O场景中为2%,证明了应急避障机制的有效性。
  • 尽管由于采用保守轨迹规划,能耗略高于E²Coop,但更高的安全性与响应速度使该权衡具有充分合理性。
  • 反事实信用分配机制实现了更精确的贡献估计,从而生成比基线方法更具鲁棒性与协作性的策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。