Skip to main content
QUICK REVIEW

[论文解读] UAV Base Station Trajectory Optimization Based on Reinforcement Learning in Post-disaster Search and Rescue Operations

Shiye Zhao, Kaoru Ota|arXiv (Cornell University)|Feb 17, 2022
UAV Applications and Optimization被引用 7
一句话总结

该论文提出了一种基于强化学习的无人机基站(UAV-BS)轨迹优化方法,与灾后幸存的地面基站(TBS)协同工作,以最大化用户设备(UE)的覆盖范围。通过使用BIRCH聚类算法预先将未服务的UE划分为可管理的区域,无人机动态部署并利用Q-learning进行训练,从而高效实现全覆盖,减少训练时间并提高系统奖励的稳定性。

ABSTRACT

Because of disaster, terrestrial base stations (TBS) would be partly crashed. Some user equipments (UE) would be unserved. Deploying unmanned aerial vehicles (UAV) as aerial base stations is a method to cover UEs quickly. But existing methods solely refer to the coverage of UAVs. In those scenarios, they focus on the deployment of UAVs in the post-disaster area where all TBSs do not work any longer. There is limited research about the combination of available TBSs and UAVs. We propose the method to deploy UAVs cooperating with available TBSs as aerial base stations. And improve the coverage by reinforcement learning. Besides, in the experiments, we cluster UEs with balanced iterative reducing and clustering using hierarchies (BIRCH) at first. Finally, achieve base stations' better coverage to UEs through Q-learning.

研究动机与目标

  • 解决灾后部分地面基站(TBS)受损区域中快速、可靠的应急通信挑战。
  • 通过将无人机与幸存的TBS集成,而非仅依赖无人机,提升覆盖效率。
  • 通过使用BIRCH聚类预处理UE分布,限制无人机的操作范围,减轻Q-learning的计算负担。
  • 通过根据聚类大小和覆盖需求动态调整无人机数量,实现无人机的动态部署。
  • 利用Q-learning优化无人机轨迹,在电池和时间约束下最大化被服务UE的数量。

提出的方法

  • 使用BIRCH聚类算法预处理未服务的UE,聚类阈值设为无人机最大通信范围(1500m),将灾区划分为更小、可管理的聚类。
  • 每个聚类分配一个无人机,根据聚类数量和空间分布动态调整无人机数量,无需预先设定聚类数量。
  • 将无人机部署与移动建模为三维网格世界环境,每个无人机作为Q-learning框架中的智能体,学习最优轨迹。
  • 定义Q-learning奖励函数,以鼓励在时间限制内完全覆盖未服务的UE,更快且更完整的服务可获得更高奖励。
  • 采用双Q-learning变体,结合ε-greedy探索(ε = 0.9,衰减至0.01)和0.5的学习率,以平衡探索与利用。
  • 模拟系统时,使用泊松点过程在TBS周围分布400个UE,TBS状态为{0,1,1,0},表示部分故障,且无人机仅服务未被覆盖的UE。

实验结果

研究问题

  • RQ1在部分TBS仍正常运行的灾后场景中,如何最优部署无人机以最大化对未服务UE的覆盖?
  • RQ2BIRCH聚类在多大程度上减少了Q-learning的状态空间,从而加速无人机轨迹优化的收敛?
  • RQ3基于聚类结果的动态无人机部署是否能提升系统可扩展性与对不同灾区规模和UE分布的适应性?
  • RQ4与仅使用无人机的部署方式相比,将幸存TBS与无人机集成对整体系统性能和能效有何影响?
  • RQ5聚类与奖励函数设计对Q-learning在无人机轨迹规划中的收敛速度与最终覆盖性能有何影响?

主要发现

  • 系统在300个时间步内(电池限制)实现了对所有未服务UE的全覆盖,表明无人机可在电量耗尽前可靠服务所有受灾人员。
  • 使用BIRCH聚类减少了每个无人机的工作负载,加快了Q-learning的收敛速度,并显著降低了实现全覆盖所需的平均步数。
  • 采用BIRCH预处理的系统在总系统奖励方面表现更高且更稳定(见图10),相较于无聚类的基线方法,表明学习效率与性能均得到提升。
  • 被分配至UE密度高或初始位置有利的聚类的无人机(如UAV₂、UAV₃、UAV₅、UAV₇)在训练早期即实现全覆盖,如图9所示其奖励曲线所示。
  • 聚类后,每集的平均步数迅速下降,表明BIRCH有效降低了Q-learning问题的复杂度。
  • 该方法实现了动态无人机部署:八架无人机被分配至八个聚类,展示了对不同空间需求的适应能力,且无需预先知晓聚类数量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。