[论文解读] Simultaneous Navigation and Radio Mapping for Cellular-Connected UAV with Deep Reinforcement Learning
本文提出了一种基于深度强化学习(DRL)的框架,名为同步导航与无线电信道制图(SNARM),用于蜂窝网络连接的无人机(UAV),以实现覆盖感知的轨迹规划。通过利用无人机信号测量结果,联合学习导航策略并构建预测性无线电信道图,SNARM相较于直接强化学习(RL),将实际飞行实验次数减少了约69%,在避免覆盖盲区方面表现更优,同时最小化任务时间和中断时长。
Cellular-connected unmanned aerial vehicle (UAV) is a promising technology to unlock the full potential of UAVs in the future. However, how to achieve ubiquitous three-dimensional (3D) communication coverage for the UAVs in the sky is a new challenge. In this paper, we tackle this challenge by a new coverage-aware navigation approach, which exploits the UAV's controllable mobility to design its navigation/trajectory to avoid the cellular BSs' coverage holes while accomplishing their missions. We formulate an UAV trajectory optimization problem to minimize the weighted sum of its mission completion time and expected communication outage duration, and propose a new solution approach based on the technique of deep reinforcement learning (DRL). To further improve the performance, we propose a new framework called simultaneous navigation and radio mapping (SNARM), where the UAV's signal measurement is used not only for training the deep Q network (DQN) directly, but also to create a radio map that is able to predict the outage probabilities at all locations in the area of interest. This thus enables the generation of simulated UAV trajectories and predicting their expected returns, which are then used to further train the DQN via Dyna technique, thus greatly improving the learning efficiency.
研究动机与目标
- 解决因地面基站部署优化而导致的无人机缺乏全域天空覆盖的非均匀三维蜂窝网络覆盖问题。
- 克服传统基于优化的无人机轨迹设计方法的局限性,这些方法依赖于简化的、不准确的通信模型。
- 开发一种数据高效、端到端的学习框架,仅使用无人机信号测量结果,实现自主的、覆盖感知的导航。
- 通过将从学习到的无线电信道图中生成的模拟经验整合到训练过程中,提升强化学习的样本效率。
- 使无人机能够在复杂的真实无线电环境中,有效避免覆盖盲区并最小化通信中断,同时完成任务目标。
提出的方法
- 提出一种直接的深度强化学习(DRL)方法,采用双值双深度Q网络(dueling DDQN)并结合多步学习,将信号测量结果直接映射为导航动作。
- 引入SNARM框架,通过无人机信号测量结果同步学习无线电信道图,预测环境中各区域的中断概率。
- 采用Dyna技术,从学习到的无线电信道图中生成合成轨迹和回报,用于增强真实经验,提高DQN训练效率。
- 使用每轮真实步长对应动态增加的模拟步数(从1步增至10步),以在训练过程中平衡探索与利用。
- 利用最先进的双值DDQN架构,分离价值函数与优势函数,提升策略学习的稳定性和性能。
- 使用密集奖励函数训练DQN,该函数结合任务完成时间与预期通信中断时长,并对信号质量较低的情况施加惩罚。
实验结果
研究问题
- RQ1基于DRL的方法是否能仅通过实时信号测量有效学习覆盖感知的无人机导航,而无需事先了解无线电环境?
- RQ2将学习到的无线电信道图整合到DRL训练过程中,相较于直接端到端RL,能否显著提升样本效率与性能?
- RQ3SNARM框架在多大程度上可减少有效策略学习所需的无人机真实飞行实验次数?
- RQ4学习到的无线电信道图是否能准确预测未访问区域的中断概率,从而实现基于模拟经验的有效路径规划?
- RQ5SNARM框架是否能使无人机识别并穿越低覆盖区域中的狭窄、高吞吐量的无线电‘通道’?
主要发现
- SNARM将实现平均回报-1500所需的无人机真实飞行实验次数从直接RL的约3200次减少至约1000次,实际数据采集量减少69%。
- 在5000次训练实验后,SNARM的回报达到-1486,优于直接RL的-1089,表明其策略性能更优。
- 仅经过200次实验后,无线电信道图的均方误差(MSE)降低了87.1%,表明其在有限数据下快速收敛且地图学习质量高。
- SNARM框架成功识别并导航通过狭窄的高吞吐量无线电通道(例如,在x ≈ 1000 m和y ≈ 1000–1700 m区域),证实其能够有效利用环境中的无线电特征。
- 尽管初期因地图不准确导致学习速度较慢,但SNARM在约1000次实验后超越直接RL,验证了来自无线电信道图的模拟经验的优越性。
- SNARM的移动平均回报呈现稳定上升趋势,表明其策略随时间推移持续稳定且有效地改进。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。