Skip to main content
QUICK REVIEW

[论文解读] Efficient Drone Mobility Support Using Reinforcement Learning

Yun Chen, Xingqin Lin|arXiv (Cornell University)|Nov 21, 2019
UAV Applications and Optimization参考文献 11被引用 9
一句话总结

本文提出了一种基于强化学习的切换(HO)机制,采用Q-learning优化蜂窝网络中无人机的移动性,平衡信号强度与切换信令开销。通过根据RSRP和切换成本权重动态调整切换决策,该方法将切换次数最多减少82.9%,同时保持可靠的连接性并最小化信号质量损失。

ABSTRACT

Flying drones can be used in a wide range of applications and services from surveillance to package delivery. To ensure robust control and safety of drone operations, cellular networks need to provide reliable wireless connectivity to drone user equipments (UEs). To date, existing mobile networks have been primarily designed and optimized for serving ground UEs, thus making the mobility support in the sky challenging. In this paper, a novel handover (HO) mechanism is developed for a cellular-connected drone system to ensure robust wireless connectivity and mobility support for drone-UEs. By leveraging tools from reinforcement learning, HO decisions are dynamically optimized using a Q-learning algorithm to provide an efficient mobility support in the sky. The results show that the proposed approach can significantly reduce (e.g., by 80%) the number of HOs, while maintaining connectivity, compared to the baseline HO scheme in which the drone always connects to the strongest cell.

研究动机与目标

  • 解决由于无人机三维移动性以及倾斜式地面基站导致的非均匀覆盖,从而在蜂窝连接无人机网络中频繁且低效切换的问题。
  • 开发一种动态、自适应的切换决策机制,以减少因乒乓切换导致的信令开销和无线链路失败。
  • 在最小化切换频率与保持较强的接收信号强度(RSRP)以确保无人机连接可靠性之间实现平衡。
  • 提供一种灵活且可学习的框架,可通过奖励函数权重进行调节,以适应不同的运行优先级。

提出的方法

  • 采用Q-learning框架将切换决策过程建模为马尔可夫决策过程,无人机-UE根据状态转移学习最优切换动作。
  • 状态空间由无人机的二维位置和当前服务小区定义,RSRP值被量化为50×50 m²的网格以离散化环境。
  • 动作空间包括执行切换的决策以及选择新的服务基站,动作基于学习到的Q值进行选择。
  • 设计自定义奖励函数,结合两个加权分量:RSRP增益(信号质量)和每次切换的惩罚,以抑制过多信令。
  • 使用2000次模拟运行进行算法训练,飞行轨迹随机生成,探索参数设置为α=0.5、λ=0.3、ε=0.2。
  • 系统使用从二维网格采集的真实世界RSRP数据,经归一化和量化后生成用于训练和评估的代表性覆盖图。

实验结果

研究问题

  • RQ1如何有效应用强化学习来优化具有动态移动性的三维空域中蜂窝连接无人机的切换决策?
  • RQ2在最小化切换频率与保持高接收信号强度(RSRP)之间存在何种权衡,以确保无人机-UE的性能?
  • RQ3与始终连接到信号最强小区的方案相比,基于Q-learning的方法是否能减少乒乓切换和信令开销?
  • RQ4在奖励函数中对切换成本与RSRP的不同权重设置,如何影响连接质量与切换频率之间的性能权衡?
  • RQ5所提出的基于强化学习的方案在减少切换频率的同时,是否仍能保持足够的信号质量?

主要发现

  • 当切换成本权重设置为1时,所提出的基于Q-learning的切换机制相比基线方案(始终连接到信号最强小区)将平均切换次数减少了82.9%。
  • 当切换成本权重为1时,最坏情况(第5百分位)的RSRP相比基线下降约4.5 dB,表明在实现显著减少切换的同时,该权衡是可接受的。
  • 当切换成本权重比为1/9时,该方案有至少80%的概率将切换频率减少50%以上,同时仅造成轻微的RSRP损失。
  • 在所有配置下,RSRP的累积分布函数(CDF)均保持在-85 dBm以上,确保在切换减少的情况下仍能维持可靠的连接。
  • 切换次数和切换比例的CDF显示,强化学习方案在所有情况下均优于基线方案,尤其在切换成本权重较高时表现更优。
  • 结果表明,基于强化学习的方法在信令开销与信号质量之间实现了灵活且可调节的权衡,适用于实际部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。