[论文解读] Multi-UAV Mobile Edge Computing and Path Planning Platform based on Reinforcement Learning
本文提出了一种基于深度强化学习的多无人机移动边缘计算与路径规划平台,联合优化服务质量(QoS)、风险规避与能效。通过整合S型需求函数及结合几何距离、风险与用户需求的奖励矩阵,该框架在障碍物密集、动态环境中表现出优越的QoS与鲁棒性,显著优于A*与贪婪基线方法,且极少发生死锁。
Unmanned Aerial vehicles (UAVs) are widely used as network processors in mobile networks, but more recently, UAVs have been used in Mobile Edge Computing as mobile servers. However, there are significant challenges to use UAVs in complex environments with obstacles and cooperation between UAVs. We introduce a new multi-UAV Mobile Edge Computing platform, which aims to provide better Quality-of-Service and path planning based on reinforcement learning to address these issues. The contributions of our work include: 1) optimizing the quality of service for mobile edge computing and path planning in the same reinforcement learning framework; 2) using a sigmoid-like function to depict the terminal users' demand to ensure a higher quality of service; 3) applying synthetic considerations of the terminal users' demand, risk and geometric distance in reinforcement learning reward matrix to ensure the quality of service, risk avoidance, and the cost-savings. Simulations have shown the effectiveness and feasibility of our platform, which can help advance related researches.
研究动机与目标
- 解决传统无人机移动边缘计算路径规划方法在动态环境中适应性差及频繁死锁的局限性。
- 将服务质量优化与路径规划统一于单一强化学习框架中,综合考虑用户需求、风险与几何约束。
- 通过自适应的实时策略学习,提升复杂障碍物环境中的QoS与任务可靠性。
- 通过共享状态信息实现多无人机协作,以节省成本并避免碰撞。
提出的方法
- 该平台采用基于深度Q网络(DQN)的强化学习框架,学习最优无人机轨迹与任务分配。
- 采用S型函数建模终端用户需求,以更准确反映非线性服务满意度,提升QoS。
- 奖励函数结合三个分量:几何距离、风险(碰撞概率)与用户需求,支持可调系数以实现权衡。
- 无人机共享用户位置与障碍物的实时信息,以实现协同路径规划并避免局部最优。
- 框架根据用户需求与环境条件的动态变化,动态调整策略,实现实时适应。
- 系统在包含障碍物与移动用户的三维仿真环境中进行训练,以在真实约束下评估性能。
实验结果
研究问题
- RQ1统一的强化学习框架能否在多无人机移动边缘计算中联合优化QoS、路径规划与风险规避?
- RQ2在动态无人机服务场景中,S型用户需求函数相较于线性模型如何提升QoS?
- RQ3与A*等传统算法相比,所提出的基于强化学习的平台在QoS、路径效率与死锁鲁棒性方面表现如何?
- RQ4不同奖励函数系数(K表示路径长度,M表示风险)如何影响QoS、安全性与能效之间的权衡?
主要发现
- 所提出的强化学习平台在所有测试条件下均实现QoS=1.00,显著优于A*(最高QoS=0.61),尤其在路径长度与风险惩罚较高的情况下。
- 当K=50且M=0.5时,平台保持QoS=1.00,同时将平均路径长度降低至1.13,风险降至0.36,展现出卓越的效率与安全性。
- 当K>10时,A*算法频繁陷入死锁,而强化学习框架在所有测试条件下均保持稳定并完成任务。
- 当K=5且M=0.5时,奖励函数实现最佳平衡,达成QoS=1.00、路径长度=1.09、风险=4.42,各项指标均优于A*。
- S型需求函数通过捕捉非线性用户满意度,尤其在高需求场景下,实现更优的任务分配与QoS提升。
- 在高风险条件下,平台将平均风险降低高达75%,证实了其在碰撞规避与安全优化方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。