[论文解读] Learning to Seek: Autonomous Source Seeking with Deep Reinforcement Learning Onboard a Nano Drone Microcontroller
本文提出了一种轻量级、端到端的深度强化学习(DRL)策略,可在仅使用低功耗Cortex-M4微控制器的情况下,实现纳米四旋翼飞行器的自主源寻址。通过设计资源感知的观测空间和超小型神经网络,该系统在复杂真实环境中的成功率达到94%,相比以往基于学习的方法,效率提高70%,功耗降低3倍。
We present fully autonomous source seeking onboard a highly constrained nano quadcopter, by contributing application-specific system and observation feature design to enable inference of a deep-RL policy onboard a nano quadcopter. Our deep-RL algorithm finds a high-performance solution to a challenging problem, even in presence of high noise levels and generalizes across real and simulation environments with different obstacle configurations. We verify our approach with simulation and in-field testing on a Bitcraze CrazyFlie using only the cheap and ubiquitous Cortex-M4 microcontroller unit. The results show that by end-to-end application-specific system design, our contribution consumes almost three times less additional power, as compared to competing learning-based navigation approach onboard a nano quadcopter. Thanks to our observation space, which we carefully design within the resource constraints, our solution achieves a 94% success rate in cluttered and randomized test environments, as compared to the previously achieved 80%. We also compare our strategy to a simple finite state machine (FSM), geared towards efficient exploration, and demonstrate that our policy is more robust and resilient at obstacle avoidance as well as up to 70% more efficient in source seeking. To this end, we contribute a cheap and lightweight end-to-end tiny robot learning (tinyRL) solution, running onboard a nano quadcopter, that proves to be robust and efficient in a challenging task using limited sensory input.
研究动机与目标
- 在硬件资源极度受限的纳米四旋翼飞行器上,实现完全自主、实时的源寻址。
- 与现有基于学习的纳米无人机导航系统相比,降低功耗和计算开销。
- 设计一种轻量级、可泛化的DRL策略,仅依赖最少的感官输入且无需环境先验知识。
- 仅使用单个光源传感器,在GPS拒止、动态环境中实现鲁棒的障碍物规避和高效的源寻址。
- 在真实飞行测试中,无需微调或环境特定再训练,实现零样本仿真到现实的迁移。
提出的方法
- 设计了针对应用的POMDP公式,包含特定的观测特征:归一化的光强梯度和滤波后的光强。
- 实现了一个超小型深度神经网络,包含两层隐藏层,优化后可在Cortex-M4微控制器上以100 Hz运行。
- 对原始光传感器读数使用低通滤波器,以减少噪声并提高梯度估计精度。
- 将策略输入表示为归一化特征(s₁:梯度,s₂:滤波后的强度),以增强对传感器噪声和姿态变化的鲁棒性。
- 在模拟环境(Air Learning)中训练DRL策略,随机设置障碍物位置和源位置。
- 实现从仿真到现实的零样本迁移,无需微调或环境特定再训练。
实验结果
研究问题
- RQ1能否在仅配备Cortex-M4微控制器和最少传感器的纳米四旋翼飞行器上,高效部署深度强化学习策略?
- RQ2与有限状态机(FSM)相比,基于DRL的源寻址器在障碍物规避和源寻址效率方面表现如何?
- RQ3该系统在训练仿真环境之外的未见过的真实世界环境中,泛化能力如何?
- RQ4与现有基于学习的导航系统相比,部署DRL策略在纳米无人机上的功耗和能量开销是多少?
- RQ5定制的观测空间设计在高传感器噪声和有限感官输入条件下,对实现鲁棒源寻址的有效性如何?
主要发现
- 所提出的DRL策略在复杂且随机分布障碍物的真实飞行测试中,实现了94%的成功率,显著优于先前最先进方法(仿真中为80%,复杂环境中为30%)。
- 与有限状态机基线相比,该系统在源寻址效率上提高了70%,在低、中、高障碍物密度下,任务时间分别减少了70%、55%和66%。
- 该策略表现出鲁棒的障碍物规避能力,避免陷入黑暗区域或循环轨迹,而FSM基线则表现出更高的方差,且偶有被困现象。
- 系统仅额外消耗0.71W功耗,相比同类基于学习的导航系统在纳米无人机上的实现,额外功耗降低了3倍。
- 尽管增加了传感器和MCU,续航时间仅从7:06.3减少至6:30.8,减少了35.5秒,表明能量开销极低。
- 观测空间设计——使用归一化的光强梯度和低通滤波后的强度——在高噪声和动态飞行条件下,对实现可靠的梯度跟踪起到了关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。