[论文解读] Path Planning for UAV-Mounted Mobile Edge Computing with Deep Reinforcement Learning
本文提出了一种基于深度强化学习的无人机(UAV)路径规划算法,用于无人机搭载的移动边缘计算系统,可动态服务具有服务质量(QoS)保障的移动用户。通过采用一种新型的QoS感知ε-greedy策略的QoS感知双深度Q网络(DDQN),UAV优化了轨迹和用户关联,以最大化系统奖励,并在所有用户中实现了99%的QoS满足率,其收敛速度和吞吐量均优于传统的DQN和Q-learning方法。
In this letter, we study an unmanned aerial vehicle (UAV)-mounted mobile edge computing network, where the UAV executes computational tasks offloaded from mobile terminal users (TUs) and the motion of each TU follows a Gauss-Markov random model. To ensure the quality-of-service (QoS) of each TU, the UAV with limited energy dynamically plans its trajectory according to the locations of mobile TUs. Towards this end, we formulate the problem as a Markov decision process, wherein the UAV trajectory and UAV-TU association are modeled as the parameters to be optimized. To maximize the system reward and meet the QoS constraint, we develop a QoS-based action selection policy in the proposed algorithm based on double deep Q-network. Simulations show that the proposed algorithm converges more quickly and achieves a higher sum throughput than conventional algorithms.
研究动机与目标
- 解决移动用户位置动态变化的移动边缘计算网络中无人机轨迹动态规划的挑战。
- 确保移动用户在位置随时间变化的情况下仍能获得服务质量(QoS)保障。
- 在能量和QoS约束下,联合优化无人机轨迹与用户关联。
- 为由移动用户移动性引起的巨大状态空间和动作空间提供可扩展的解决方案。
- 与传统强化学习方法相比,提升收敛速度和系统吞吐量。
提出的方法
- 将无人机路径规划问题建模为马尔可夫决策过程(MDP),并将轨迹与用户关联作为控制变量。
- 使用高斯-马尔可夫随机模型(GMRM)对用户移动性进行建模,以反映真实的用户移动模式。
- 在双深度Q网络(DDQN)框架内提出一种基于QoS的ε-greedy探索策略,优先考虑QoS约束下的动作。
- 采用系统奖励函数,平衡任务卸载吞吐量与能耗。
- 使用经验回放和目标网络技术端到端训练DNN策略,以稳定学习过程。
- 将QoS约束直接集成到动作选择策略中,以确保每个用户的高可靠性。
实验结果
研究问题
- RQ1如何动态优化无人机轨迹,以服务具有时变用户位置的移动边缘计算网络中的移动用户?
- RQ2哪种强化学习方法能有效处理由移动用户移动性引发的巨大状态空间和动作空间?
- RQ3如何将单个用户的QoS约束嵌入学习策略中,以确保服务可靠性?
- RQ4与标准ε-greedy策略相比,QoS感知的探索策略是否能提升学习收敛速度和系统性能?
- RQ5在不同用户移动性和网络条件下,所提算法在吞吐量、收敛速度和QoS保障方面的表现如何?
主要发现
- 在仿真中,所提算法在DQN、DQL和QL基线方法中实现了最高的平均奖励和最快的收敛速度。
- 在所有测试的用户数量和速度下,所提方法均实现了系统每回合的最高总吞吐量。
- 在低用户速度(例如1 m/s)下,所提算法实现了峰值总吞吐量,表明在类似静态条件下表现接近最优。
- 基于QoS的ε-greedy策略确保了每个用户99%的保障率,显著优于传统ε-greedy策略。
- 该算法在不同用户速度下保持鲁棒性,即使在训练中未见过的速度下也能维持收敛。
- 所提方法避免了表格型Q学习(QL)和DQL的可扩展性问题,后者在高用户数量(例如>8000)时因状态-动作空间过大而失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。