Skip to main content
QUICK REVIEW

[论文解读] Multi-Agent Deep Reinforcement Learning Based Trajectory Planning for Multi-UAV Assisted Mobile Edge Computing

Liang Wang, Kezhi Wang|arXiv (Cornell University)|Sep 23, 2020
UAV Applications and Optimization参考文献 37被引用 8
一句话总结

该论文提出了一种基于多智能体深度强化学习(MADDPG)的多无人机(UAV)辅助移动边缘计算轨迹规划框架,联合优化用户设备(UE)公平性、无人机负载均衡和能量效率。在3至4架无人机的仿真中,该方法性能优越——公平性指数达到0.9,同时降低了用户设备的能量消耗,优于RANDOM和CIRCLE等基准方法。

ABSTRACT

An unmanned aerial vehicle (UAV)-aided mobile edge computing (MEC) framework is proposed, where several UAVs having different trajectories fly over the target area and support the user equipments (UEs) on the ground. We aim to jointly optimize the geographical fairness among all the UEs, the fairness of each UAV' UE-load and the overall energy consumption of UEs. The above optimization problem includes both integer and continues variables and it is challenging to solve. To address the above problem, a multi-agent deep reinforcement learning based trajectory control algorithm is proposed for managing the trajectory of each UAV independently, where the popular Multi-Agent Deep Deterministic Policy Gradient (MADDPG) method is applied. Given the UAVs' trajectories, a low-complexity approach is introduced for optimizing the offloading decisions of UEs. We show that our proposed solution has considerable performance over other traditional algorithms, both in terms of the fairness for serving UEs, fairness of UE-load at each UAV and energy consumption for all the UEs.

研究动机与目标

  • 解决多无人机移动边缘计算(MEC)系统中联合优化地面用户设备(UE)地理公平性、无人机负载公平性以及整体UE能量消耗的挑战。
  • 在存在混合整数与连续优化变量的情况下,通过多智能体强化学习以去中心化、协作的方式管理无人机轨迹。
  • 在无人机轨迹确定后,为用户设备实现低复杂度的卸载决策,确保实际部署的可行性。
  • 相较于传统轨迹策略(如随机移动、圆形飞行和固定模式),提升系统性能。
  • 展示MADDPG在处理复杂、动态的无人机-用户设备交互关系方面,在真实世界约束下的有效性。

提出的方法

  • 采用多智能体深度确定性策略梯度(MADDPG)算法,使每架无人机能够独立学习最优轨迹,以最大化联合奖励函数。
  • 奖励函数包含三个组成部分:用户设备之间的公平性、每架无人机上用户设备负载的公平性,以及总UE能量消耗的降低。
  • 通过与模拟环境的持续交互学习轨迹,无人机观测用户设备位置并调整自身位置以更高效地服务更多用户设备。
  • 在轨迹优化完成后,采用低复杂度算法根据无人机与用户设备的接近程度和信道条件,确定用户设备的卸载决策。
  • 该方法采用集中式训练、去中心化执行(CTDE)范式,实现在保持个体控制的同时实现协作行为。
  • 基准策略包括MAT(所提方法)、RANDOM(无人机随机移动)和CIRCLE(无人机围绕用户设备集群呈圆形飞行)。

实验结果

研究问题

  • RQ1多智能体深度强化学习方法是否能有效平衡多无人机MEC系统中地面用户设备之间的公平性以及无人机之间的负载?
  • RQ2所提出的基于MADDPG的轨迹控制方法与固定模式基准方法(如CIRCLE、RANDOM)相比,在公平性和能量效率方面表现如何?
  • RQ3所提方法在保持高质量服务的前提下,能在多大程度上降低整体用户设备能量消耗?
  • RQ4去中心化学习框架是否能够在无需集中协调的情况下实现无人机的协作行为?
  • RQ5时间槽(TS)数量和无人机数量如何影响所提轨迹规划方法的收敛性和性能?

主要发现

  • 在4架无人机条件下,所提MAT方法实现了0.9的用户设备服务公平性指数,显著优于CIRCLE(0.6)和RANDOM(0.5)。
  • MAT方法使每架无人机上用户设备负载的公平性接近1.0,表明负载分配均衡;而RANDOM仅达到0.75。
  • MAT在降低总用户设备能量消耗方面优于CIRCLE和RANDOM,展现出更高的能量效率。
  • 在4架无人机条件下,MAT将每用户设备的最小服务时隙数从约2.5提升至约6,相比3架无人机时,提升了服务可靠性。
  • MAT的性能增益在不同时间槽数量下保持一致,随着分配的时间槽增多,公平性和能量效率持续提升。
  • 热力图可视化结果证实,MAT驱动的无人机协同覆盖了高需求区域,避免了重复服务或服务遗漏。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。