Skip to main content
QUICK REVIEW

[论文解读] A Deep Reinforcement Learning Approach to Efficient Drone Mobility Support

Yun Chen, Xingqin Lin|arXiv (Cornell University)|May 11, 2020
UAV Applications and Optimization参考文献 29被引用 5
一句话总结

本文提出了一种基于深度Q网络(DQN)的强化学习框架,用于优化陆地5G蜂窝网络中无人机的切换决策,在保持可靠连接的同时减少信令开销。该方法动态平衡切换频率与信号强度,在95%的飞行场景中实现高达10倍的切换次数减少,最坏情况下仅造成4.5 dB的RSRP退化。

ABSTRACT

The growing deployment of drones in a myriad of applications relies on seamless and reliable wireless connectivity for safe control and operation of drones. Cellular technology is a key enabler for providing essential wireless services to flying drones in the sky. Existing cellular networks targeting terrestrial usage can support the initial deployment of low-altitude drone users, but there are challenges such as mobility support. In this paper, we propose a novel handover framework for providing efficient mobility support and reliable wireless connectivity to drones served by a terrestrial cellular network. Using tools from deep reinforcement learning, we develop a deep Q-learning algorithm to dynamically optimize handover decisions to ensure robust connectivity for drone users. Simulation results show that the proposed framework significantly reduces the number of handovers at the expense of a small loss in signal strength relative to the baseline case where a drone always connect to a base station that provides the strongest received signal strength.

研究动机与目标

  • 解决无人机在陆地5G网络中移动时频繁且低效的切换问题。
  • 克服传统基于信号强度的切换策略所导致的过度信令和乒乓效应的局限性。
  • 开发一种动态、自适应的切换机制,以平衡切换代价与接收信号强度,提升网络效率。
  • 利用深度强化学习为高空、高速移动的无人机用户提供稳健且低时延的连接。
  • 提供一种可扩展的无人机移动性管理解决方案,在复杂、大规模环境中优于表格型Q-learning。

提出的方法

  • 将无人机切换问题建模为马尔可夫决策过程(MDP),其中无人机的状态包括位置、速度以及邻近基站(BS)的信号强度。
  • 设计一个深度Q网络(DQN)智能体,基于结合了接收信号强度(RSRP)与切换代价的奖励函数,学习最优切换动作。
  • 使用经验回放和目标网络来稳定DQN算法的训练过程并提升收敛性。
  • 在具有多个BS的模拟城市环境中训练DQN智能体,采用真实的传播模型和无人机飞行轨迹。
  • 通过调整切换代价与RSRP之间的权重比例,优化奖励函数,实现信令开销与链路质量之间的权衡控制。
  • 将基于DQN的策略与始终选择最强服务基站的贪婪基线方法进行对比评估。

实验结果

研究问题

  • RQ1与基于信号强度的贪婪策略相比,基于深度强化学习的切换策略是否能显著减少切换次数?
  • RQ2所提出的DQN框架在最小化切换频率的同时,能在多大程度上维持可靠的连接?
  • RQ3在不同飞行条件下,切换代价与信号强度之间的权衡如何影响网络性能?
  • RQ4在切换减少和信号质量方面,DQN与表格型Q-learning之间存在多大的性能差距?
  • RQ5在地理范围更大、状态空间维度更高的场景下,DQN方法的可扩展性如何?

主要发现

  • 当切换代价与RSRP的权重比设置为1:1时,所提出的基于DQN的切换方案在70%的无人机飞行中可将切换次数减少至原来的十分之一。
  • 在90%的飞行中,切换次数减少至少5倍;在98%的飞行中,减少至少2倍。
  • 与贪婪基线相比,最坏情况下的第5百分位RSRP退化仅为4.5 dB,表明对链路质量的影响极小。
  • 在1:9的权重比下,DQN方法的平均切换比率(HO ratio)达到0.143,优于表格型Q-learning在切换减少和稳定性方面的表现。
  • 所有场景下的最小RSRP均超过-82 dBm,对应信噪比(SNR)为31 dB,确保在典型1 MHz带宽条件下的可靠连接。
  • 与表格型Q-learning相比,DQN方法更具可扩展性,因为它避免了后者在大规模或三维移动场景中因状态空间指数级增长而受到的限制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。