[论文解读] Explainable Deep Reinforcement Learning for UAV Autonomous Navigation
本文提出了一种基于深度强化学习(DRL)的无人机(UAV)自主导航反应式控制器,用于未知的室外环境,结合可解释人工智能技术以解析决策过程。该方法实现了60Hz的实时控制性能,并通过显著性图和特征归因提供视觉和文本解释,使非专家和设计人员均能理解并改进模型行为。
Autonomous navigation in unknown complex environment is still a hard problem, especially for small Unmanned Aerial Vehicles (UAVs) with limited computation resources. In this paper, a neural network-based reactive controller is proposed for a quadrotor to fly autonomously in unknown outdoor environment. The navigation controller makes use of only current sensor data to generate the control signal without any optimization or configuration space searching, which reduces both memory and computation requirement. The navigation problem is modelled as a Markov Decision Process (MDP) and solved using deep reinforcement learning (DRL) method. Specifically, to get better understanding of the trained network, some model explanation methods are proposed. Based on the feature attribution, each decision making result during flight is explained using both visual and texture explanation. Moreover, some global analysis are also provided for experts to evaluate and improve the trained neural network. The simulation results illustrated the proposed method can make useful and reasonable explanation for the trained model, which is beneficial for both non-expert users and controller designer. Finally, the real world tests shown the proposed controller can navigate the quadrotor to goal position successfully and the reactive controller performs much faster than some conventional approach under the same computation resource.
研究动机与目标
- 解决在计算资源有限的未知复杂室外环境中实现无人机自主导航的挑战。
- 通过引入可解释性技术,克服深度强化学习模型在无人机控制中固有的黑箱特性。
- 开发一种仅依赖当前传感器数据的反应式控制策略,避免地图维护和优化开销。
- 通过视觉和文本解释,使非专家用户和控制器设计人员能够理解并改进DRL策略。
- 展示所提出的基于DRL的控制器在真实场景中的可行性与计算效率。
提出的方法
- 将无人机避障问题建模为马尔可夫决策过程(MDP),并使用TD3算法求解深度强化学习(DRL)。
- 实现一种反应式控制器,直接从当前传感器输入生成控制指令,无需地图或轨迹优化。
- 提出一种新颖的显著性图生成方法,结合类别激活映射(CAM)与SHAP值,用于解释卷积神经网络(CNN)感知的视觉解释。
- 利用特征归因生成每项控制决策的文本解释,例如“因右侧有障碍物而向右转向”。
- 在自定义的Gazebo仿真环境中重新训练DRL模型,加入树木障碍物以减小仿真到现实的领域差距。
- 将训练好的策略直接部署至PX4 SITL环境中的真实四旋翼无人机上,并在60Hz下评估性能。
实验结果
研究问题
- RQ1如何利用深度强化学习实现在计算开销极小的未知环境中实时、反应式的无人机导航?
- RQ2特征归因与显著性图在多大程度上能为基于DRL的无人机控制决策提供有意义且可解释的说明?
- RQ3视觉与文本解释能否提升非专家用户在无人机应用中对DRL控制器的信任度与可用性?
- RQ4在相同硬件约束下,基于DRL的反应式控制器与传统基于优化的规划器在真实飞行中的性能表现如何比较?
- RQ5将DRL策略从仿真环境迁移到真实无人机飞行的主要挑战是什么?如何加以缓解?
主要发现
- 经过20,000次训练时间步后,基于DRL的反应式控制器在含有树木障碍物的仿真环境中实现了75%的导航成功率。
- 该控制器在真实飞行中实现了60Hz的运行频率,显著优于同一硬件上仅能运行10Hz的3DVFH+传统规划器。
- 通过混合CAM-SHAP方法生成的视觉解释有效突出了影响控制决策的关键图像区域,如障碍物。
- 基于特征归因的文本解释成功描述了每项动作的决策依据,例如“因前方左侧检测到障碍物而向左转向”。
- 尽管仿真中行为平稳,但真实飞行测试中发现输出存在振荡现象,表明仿真与真实动力学或传感器输入之间存在领域差距。
- 该模型的可解释性框架使非专家和设计人员均能理解并识别策略中的潜在问题,支持未来进一步微调。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。