Skip to main content
QUICK REVIEW

[论文解读] Learning to Seek: Autonomous Source Seeking with Deep Reinforcement Learning Onboard a Nano Drone Microcontroller

Bardienus P. Duisterhof, Srivatsan Krishnan|arXiv (Cornell University)|Sep 25, 2019
Malaria Research and Control参考文献 29被引用 20
一句话总结

本文提出了一种轻量级、端到端的深度强化学习(DRL)策略,可在仅使用低功耗Cortex-M4微控制器的情况下,实现纳米四旋翼飞行器的自主源寻址。通过设计资源感知的观测空间和超小型神经网络,该系统在复杂真实环境中的成功率达到94%,相比以往基于学习的方法,效率提高70%,功耗降低3倍。

ABSTRACT

We present fully autonomous source seeking onboard a highly constrained nano quadcopter, by contributing application-specific system and observation feature design to enable inference of a deep-RL policy onboard a nano quadcopter. Our deep-RL algorithm finds a high-performance solution to a challenging problem, even in presence of high noise levels and generalizes across real and simulation environments with different obstacle configurations. We verify our approach with simulation and in-field testing on a Bitcraze CrazyFlie using only the cheap and ubiquitous Cortex-M4 microcontroller unit. The results show that by end-to-end application-specific system design, our contribution consumes almost three times less additional power, as compared to competing learning-based navigation approach onboard a nano quadcopter. Thanks to our observation space, which we carefully design within the resource constraints, our solution achieves a 94% success rate in cluttered and randomized test environments, as compared to the previously achieved 80%. We also compare our strategy to a simple finite state machine (FSM), geared towards efficient exploration, and demonstrate that our policy is more robust and resilient at obstacle avoidance as well as up to 70% more efficient in source seeking. To this end, we contribute a cheap and lightweight end-to-end tiny robot learning (tinyRL) solution, running onboard a nano quadcopter, that proves to be robust and efficient in a challenging task using limited sensory input.

研究动机与目标

  • 在硬件资源极度受限的纳米四旋翼飞行器上,实现完全自主、实时的源寻址。
  • 与现有基于学习的纳米无人机导航系统相比,降低功耗和计算开销。
  • 设计一种轻量级、可泛化的DRL策略,仅依赖最少的感官输入且无需环境先验知识。
  • 仅使用单个光源传感器,在GPS拒止、动态环境中实现鲁棒的障碍物规避和高效的源寻址。
  • 在真实飞行测试中,无需微调或环境特定再训练,实现零样本仿真到现实的迁移。

提出的方法

  • 设计了针对应用的POMDP公式,包含特定的观测特征:归一化的光强梯度和滤波后的光强。
  • 实现了一个超小型深度神经网络,包含两层隐藏层,优化后可在Cortex-M4微控制器上以100 Hz运行。
  • 对原始光传感器读数使用低通滤波器,以减少噪声并提高梯度估计精度。
  • 将策略输入表示为归一化特征(s₁:梯度,s₂:滤波后的强度),以增强对传感器噪声和姿态变化的鲁棒性。
  • 在模拟环境(Air Learning)中训练DRL策略,随机设置障碍物位置和源位置。
  • 实现从仿真到现实的零样本迁移,无需微调或环境特定再训练。

实验结果

研究问题

  • RQ1能否在仅配备Cortex-M4微控制器和最少传感器的纳米四旋翼飞行器上,高效部署深度强化学习策略?
  • RQ2与有限状态机(FSM)相比,基于DRL的源寻址器在障碍物规避和源寻址效率方面表现如何?
  • RQ3该系统在训练仿真环境之外的未见过的真实世界环境中,泛化能力如何?
  • RQ4与现有基于学习的导航系统相比,部署DRL策略在纳米无人机上的功耗和能量开销是多少?
  • RQ5定制的观测空间设计在高传感器噪声和有限感官输入条件下,对实现鲁棒源寻址的有效性如何?

主要发现

  • 所提出的DRL策略在复杂且随机分布障碍物的真实飞行测试中,实现了94%的成功率,显著优于先前最先进方法(仿真中为80%,复杂环境中为30%)。
  • 与有限状态机基线相比,该系统在源寻址效率上提高了70%,在低、中、高障碍物密度下,任务时间分别减少了70%、55%和66%。
  • 该策略表现出鲁棒的障碍物规避能力,避免陷入黑暗区域或循环轨迹,而FSM基线则表现出更高的方差,且偶有被困现象。
  • 系统仅额外消耗0.71W功耗,相比同类基于学习的导航系统在纳米无人机上的实现,额外功耗降低了3倍。
  • 尽管增加了传感器和MCU,续航时间仅从7:06.3减少至6:30.8,减少了35.5秒,表明能量开销极低。
  • 观测空间设计——使用归一化的光强梯度和低通滤波后的强度——在高噪声和动态飞行条件下,对实现可靠的梯度跟踪起到了关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。