[论文解读] Deep Reinforcement Learning Based Multi-Access Edge Computing Schedule for Internet of Vehicle
本文提出了一种多智能体图卷积深度强化学习(M-AGCDRL)算法,用于优化无人机(UAV)辅助车联网(IoV)网络中的多接入边缘计算(MEC)调度。通过结合图注意力网络实现多智能体协作与演员-评论家深度强化学习,该方法在收敛速度和用户体验质量(QoE)方面优于标准Q-learning和演员-评论家基线方法,在任务卸载性能上最高提升20%,并在动态交通条件下保持稳定的QoS。
As intelligent transportation systems been implemented broadly and unmanned arial vehicles (UAVs) can assist terrestrial base stations acting as multi-access edge computing (MEC) to provide a better wireless network communication for Internet of Vehicles (IoVs), we propose a UAVs-assisted approach to help provide a better wireless network service retaining the maximum Quality of Experience(QoE) of the IoVs on the lane. In the paper, we present a Multi-Agent Graph Convolutional Deep Reinforcement Learning (M-AGCDRL) algorithm which combines local observations of each agent with a low-resolution global map as input to learn a policy for each agent. The agents can share their information with others in graph attention networks, resulting in an effective joint policy. Simulation results show that the M-AGCDRL method enables a better QoE of IoTs and achieves good performance.
研究动机与目标
- 解决高移动性IoV环境中无线通信的动态性、低时延和高可靠性挑战,尤其是在地面基站容量有限的情况下。
- 通过无人机搭载的MEC服务器实现高效计算卸载,提升车辆的用户体验质量(QoE)。
- 为多个无人机开发可扩展、去中心化的调度机制,以适应不断变化的车辆密度和移动模式。
- 克服单无人机系统和传统资源分配在高计算与频谱需求的密集IoV场景下的局限性。
提出的方法
- M-AGCDRL算法采用多智能体深度强化学习框架,每个无人机作为独立智能体,可访问局部观测和低分辨率全局地图。
- 采用图卷积网络(GCNs)建模智能体间关系,并通过图注意力机制实现信息共享,提升联合策略学习效果。
- 策略网络采用演员-评论家架构,结合基于优势的价值估计与策略梯度更新,以稳定训练并提升收敛性。
- 采用集中训练、去中心化执行(CTDE)范式,使智能体在训练中学习协作行为,而在推理过程中独立行动。
- 状态空间包括车辆位置、任务队列长度和无人机位置,动作空间则控制任务卸载决策和无人机轨迹调整。
- 通过平衡QoE(通过MOS建模)、卸载成功率和能效的奖励函数进行训练,超参数通过网格搜索调优。
实验结果
研究问题
- RQ1如何在高移动性IoV环境中优化多无人机MEC调度,以最大化用户体验质量(QoE)?
- RQ2在无人机辅助IoV网络中,与独立智能体相比,引入基于图的多智能体通信在协调性和性能方面提升程度如何?
- RQ3在合成与真实交通场景下,M-AGCDRL算法与标准Q-learning和演员-评论家基线相比,在收敛速度和卸载性能方面表现如何?
- RQ4在密集IoV网络中,为平衡卸载增益与资源开销,最优无人机数量是多少?
- RQ5随着无人机和车辆数量的增加,系统如何维持稳定的QoS(MOS)?
主要发现
- 在网格世界和真实Sapporo市交通仿真中,M-AGCDRL算法相比标准Q-learning和演员-评论家方法,收敛更快,总累积奖励更高。
- 所提方法相比基线算法将卸载性能最高提升20%,且在无人机数量增加时仍保持稳定且高效的卸载率。
- 在10架无人机条件下,M-AGCDRL方法维持约92%的稳定卸载率,显著优于标准Q-learning基线的78%。
- M-AGCDRL下的平均MOS(平均意见得分)随无人机数量增加而稳步上升,最高达4.6(满分5.0),表明驾驶员获得高质量体验。
- 在高车辆密度(最高达100辆)下,系统表现出鲁棒性,得益于有效的无人机轨迹与任务调度,保持低时延和高可靠性。
- 该算法在约1,000个训练周期后收敛,1,500个周期后奖励波动显著减小,表明策略学习已趋于稳定。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。