Skip to main content
QUICK REVIEW

[论文解读] Indoor UAV Navigation to a Rayleigh Fading Source Using Q-Learning

Bekir Sait Çiftler, Adem Tuncer|arXiv (Cornell University)|May 29, 2017
UAV Applications and Optimization参考文献 6被引用 9
一句话总结

本文提出了一种无模型的Q-learning算法,用于在室内环境中基于瑞利衰落无线电信号源(如物联网设备)进行无人机导航,通过使用平均接收信号强度(RSS)观测值来缓解深度衰落的影响。主要贡献在于:可变学习率与优化的时间平均窗口显著缩短了收敛时间,优于固定学习率和先前的强化学习方法,尤其在对公共安全场景至关重要的低速无人机场景中表现更优。

ABSTRACT

Unmanned aerial vehicles (UAVs) can be used to localize victims, deliver first-aid, and maintain wireless connectivity to victims and first responders during search/rescue and public safety scenarios. In this letter, we consider the problem of navigating a UAV to a Rayleigh fading wireless signal source, e.g. the Internet-of-Things (IoT) devices such as smart watches and other wearables owned by the victim in an indoor environment. The source is assumed to transmit RF signals, and a Q-learning algorithm is used to navigate the UAV to the vicinity of the source. Our results show that the time averaging window and the exploration rate for the Q-learning algorithm can be optimized for fastest navigation of the UAV to the IoT device. As a result, Q-learning achieves the best performance with smaller convergence time overall.

研究动机与目标

  • 为解决在无GPS的室内环境中无人机导航至受害者无线电信号源的挑战,特别是在瑞利衰落条件下。
  • 缓解由于室内多径衰落导致的接收信号强度(RSS)深度衰落所引起的导航偏差。
  • 开发一种无模型的强化学习方法,无需预先了解环境或RSS模型。
  • 优化关键的Q-learning参数——时间平均窗口与学习率,以实现更快的收敛速度。
  • 将所提出的Q-learning方法与现有基于强化学习的技术进行比较,尤其关注与公共安全相关的低速场景。

提出的方法

  • 采用Q-learning算法,基于RSS观测值实现无人机导航,无需对环境或RSS动态特性进行先验建模。
  • 奖励函数定义为连续平均RSS值之间的差值,以鼓励向更强信号方向移动。
  • RSS值在时间窗口 $ T_S $ 内进行平均,以减少瑞利衰落引起的深度衰落影响。
  • 采用可变学习率,根据当前状态动态调整,以提高响应速度与收敛速度。
  • 算法使用 $ \epsilon $-greedy探索策略,在训练过程中平衡探索与利用。
  • 通过模拟传感器检测碰撞并重新选择动作来实现障碍物规避。

实验结果

研究问题

  • RQ1在瑞利衰落的室内环境中,对不同持续时间的RSS进行时间平均,如何影响Q-learning的收敛时间?
  • RQ2为最小化收敛时间,学习率策略的最优选择是固定还是可变?
  • RQ3无人机速度如何影响在瑞利衰落条件下基于Q-learning的导航性能?
  • RQ4与现有基于强化学习的导航技术相比,所提出的Q-learning方法在收敛速度与鲁棒性方面表现如何?
  • RQ5无模型的强化学习方法能否有效缓解由于瑞利衰落导致的RSS深度衰落所引起的导航偏差?

主要发现

  • 与固定学习率为1相比,可变学习率显著缩短了收敛时间,提升了系统响应速度。
  • 在较低无人机速度下,所提出的Q-learning方法在[9]中提出的现有强化学习技术基础上,尤其在收敛速度方面表现更优。
  • 收敛时间随平均窗口增大而减小,直至达到最优点;此后,更长的延迟会因响应延迟增加而降低性能。
  • 在较高无人机速度下,由于在错误决策期间移动距离更长,更大的平均窗口会导致收敛时间增加。
  • 最优平均窗口在减少衰落噪声与及时决策之间实现平衡,从而实现最快导航。
  • 所提出的方法在收敛速度上优于先前工作,尤其在对公共安全与受害者定位至关重要的低速场景中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。