Skip to main content
QUICK REVIEW

[论文解读] Integrating LEO Satellite and UAV Relaying via Reinforcement Learning for Non-Terrestrial Networks

Ju-Hyung Lee, Jihong Park|arXiv (Cornell University)|May 26, 2020
UAV Applications and Optimization参考文献 18被引用 10
一句话总结

本文提出一种基于深度强化学习(DRL)的框架,用于在非地面网络中联合优化低地球轨道(LEO)卫星关联与高空平台(HAP)无人机(UAV)移动性,相比直接传输,端到端数据速率最高提升5.74倍。提出一种新颖的动作维度缩减技术,仅聚焦于邻近卫星,以应对时变拓扑下的可扩展性挑战。

ABSTRACT

A mega-constellation of low-earth orbit (LEO) satellites has the potential to enable long-range communication with low latency. Integrating this with burgeoning unmanned aerial vehicle (UAV) assisted non-terrestrial networks will be a disruptive solution for beyond 5G systems provisioning large scale three-dimensional connectivity. In this article, we study the problem of forwarding packets between two faraway ground terminals, through an LEO satellite selected from an orbiting constellation and a mobile high-altitude platform (HAP) such as a fixed-wing UAV. To maximize the end-to-end data rate, the satellite association and HAP location should be optimized, which is challenging due to a huge number of orbiting satellites and the resulting time-varying network topology. We tackle this problem using deep reinforcement learning (DRL) with a novel action dimension reduction technique. Simulation results corroborate that our proposed method achieves up to 5.74x higher average data rate compared to a direct communication baseline without SAT and HAP.

研究动机与目标

  • 为解决在动态卫星与UAV拓扑的长距离非地面网络中最大化端到端(E2E)数据速率的挑战。
  • 在时变网络环境中,联合优化高维状态空间与动作空间下的卫星关联与UAV轨迹。
  • 通过无模型深度强化学习,克服大规模卫星星座与移动UAV带来的计算复杂性。
  • 通过仅将卫星关联候选限制为源终端附近的卫星,降低动作空间维度。
  • 验证移动HAP中继相比固定中继与直接传输在频谱效率与数据速率方面的优越性。

提出的方法

  • 将端到端速率最大化问题建模为马尔可夫决策过程(MDP),其中状态空间由终端位置、卫星位置与信道条件定义。
  • 应用深度Q网络(DQN)强化学习,实时学习最优卫星关联与UAV轨迹策略。
  • 提出一种动作维度缩减技术,仅将卫星关联候选限制为从源终端最近的几颗卫星,以降低计算负载。
  • 采用基于端到端频谱效率的奖励函数,该效率由Src-SAT-HAP-Dst链路中上行链路与下行链路速率之和推导得出。
  • 采用双DQN架构,结合经验回放与目标网络,以稳定训练并提升收敛性能。
  • 将HAP建模为可控制三维位置的移动中继,通过优化其轨迹以维持与卫星和目的地之间的强链路。

实验结果

研究问题

  • RQ1如何通过联合优化LEO卫星关联与UAV移动性,提升时变拓扑下非地面网络的端到端数据速率?
  • RQ2在长距离卫星通信中,使用移动HAP中继相比固定中继或直接传输有何影响?
  • RQ3深度强化学习能否有效管理由巨型星座与移动UAV带来的高维动作与状态空间?
  • RQ4基于邻近卫星选择的动作维度缩减对学习性能与可扩展性有何影响?
  • RQ5所提出的移动HAP中继方案相比基准方案在频谱效率方面有何增益?

主要发现

  • 所提出的DRL方法相比无中继的直接传输,平均端到端数据速率提升5.74倍。
  • 与直接传输相比,该方法使频谱效率提升298.61%,凸显中继分集的关键作用。
  • 移动HAP中继方案相比固定HAP中继,频谱效率提升13.04%,凸显移动性的优势。
  • 仿真结果表明,DQN智能体在训练过程中损失较低且平均奖励随时间持续增加,表明策略学习稳定。
  • 最优关联与轨迹并非总是基于距离最近——DQN会选择能改善链路中最弱环节的链路,如图4c与4h所示。
  • HAP轨迹呈现椭圆状模式,环绕源与目的地之间的区域运行,动态适应卫星切换与信道变化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。