Skip to main content
QUICK REVIEW

[论文解读] Multi-UAV Speed Control with Collision Avoidance and Handover-aware Cell Association: DRL with Action Branching

Zijiang Yan, Wael Jaafar|arXiv (Cornell University)|Jul 24, 2023
Autonomous Vehicle Technology and SafetyEngineering被引用 3
一句话总结

该论文提出了一种具有动作分支的深度强化学习(DRL)框架,用于在三维空中高速公路中联合优化多无人机(UAV)速度控制、小区关联和碰撞避免。采用分支双 dueling Q-Network(BDQ)及其双倍变体(BDDQN),该方法在平衡交通流与切换(HO)感知通信性能方面相比基线方法提升了18.32%。

ABSTRACT

This paper presents a deep reinforcement learning solution for optimizing multi-UAV cell-association decisions and their moving velocity on a 3D aerial highway. The objective is to enhance transportation and communication performance, including collision avoidance, connectivity, and handovers. The problem is formulated as a Markov decision process (MDP) with UAVs' states defined by velocities and communication data rates. We propose a neural architecture with a shared decision module and multiple network branches, each dedicated to a specific action dimension in a 2D transportation-communication space. This design efficiently handles the multi-dimensional action space, allowing independence for individual action dimensions. We introduce two models, Branching Dueling Q-Network (BDQ) and Branching Dueling Double Deep Q-Network (Dueling DDQN), to demonstrate the approach. Simulation results show a significant improvement of 18.32% compared to existing benchmarks.

研究动机与目标

  • 解决三维空中高速公路上多无人机运动动力学与通信性能缺乏集成优化的问题。
  • 在确保碰撞避免的前提下,同时最大化空中交通流量并最小化切换(HO)损耗。
  • 开发一种基于DRL的解决方案,以在动态条件下联合处理无人机速度、换道和基站(BS)分配问题。
  • 克服现有基于Q-learning的方法在多维动作空间中收敛性和策略质量方面的局限性。
  • 实现高密度空中交通中具有动态无线连接需求的无人机的鲁棒、可扩展决策。

提出的方法

  • 将多无人机控制问题建模为马尔可夫决策过程(MDP),其中状态由无人机速度和通信数据速率定义。
  • 设计一个二维动作空间,涵盖无人机加速/减速、换道以及基站分配决策。
  • 提出一种神经网络架构,包含一个共享决策模块和多个独立分支——每个动作维度对应一个分支,以高效处理多维动作。
  • 提出两种DRL智能体:分支双 dueling Q-Network(BDQ)和分支双 dueling Double DQN(BDDQN),以增强探索-利用平衡与学习稳定性。
  • 使用带ReLU激活函数的全连接前馈网络(FNN)来近似Q值,随后通过分支头输出各独立动作的Q值。
  • 在输出层使用线性激活函数,并采用经验回放和目标网络进行训练,以提升学习稳定性。

实验结果

研究问题

  • RQ1如何联合优化多无人机速度控制、换道与小区关联,以同时最大化交通流量与通信质量?
  • RQ2在三维空中高速公路环境中,无人机速度对碰撞频率、切换频率和数据速率性能有何影响?
  • RQ3具有动作分支的DRL架构是否能优于传统DQN和DDQN,在处理多维无人机控制动作方面表现更优?
  • RQ4可用基站数量如何影响通信奖励与切换频率之间的权衡?
  • RQ5在动态无人机网络中,如何实现最大化数据速率与最小化切换相关惩罚之间的最优平衡?

主要发现

  • 所提出的BDDQN算法相比现有基线方法(包括DDQN和SDB)在整体性能上提升了18.32%。
  • 在目标速度为10 m/s时,通信奖励达到最大值;而更高速度(如20 m/s)则导致碰撞增加和运输奖励下降。
  • BDDQN在约1000次训练回合后收敛至切换率低于1%,表明其有效学习了切换避免策略。
  • 当有15个BS时,BDQN和BDDQN的通信奖励达到峰值;但进一步增加BS密度会导致切换惩罚上升,因过多的小区重选引发。
  • 当仅有5个BS时,切换率高于15个BS的情况,因为算法优先追求达到目标速度,从而触发更多切换。
  • 在10 m/s速度下,BDDQN相比SDB基线在运输奖励上提升16.7%,通信奖励提升23.4%,切换率降低10.9%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。