Skip to main content
QUICK REVIEW

[论文解读] Learning Deep Control Policies for Autonomous Aerial Vehicles with MPC-Guided Policy Search

Tianhao Zhang, Gregory Kahn|arXiv (Cornell University)|Sep 22, 2015
Advanced Control Systems Optimization参考文献 41被引用 19
一句话总结

本文提出一种MPC引导的策略搜索方法,用于训练自主飞行器的深度神经网络策略,利用模型预测控制(MPC)生成安全、高质量的训练数据,并提供完整的状态监督,而最终的策略仅依赖机载传感器输入运行。该方法在训练过程中实现了鲁棒、高速的障碍物规避,且无灾难性失败,并在推理阶段实现了显著低于MPC的计算成本,达到实时性能。

ABSTRACT

Model predictive control (MPC) is an effective method for controlling robotic systems, particularly autonomous aerial vehicles such as quadcopters. However, application of MPC can be computationally demanding, and typically requires estimating the state of the system, which can be challenging in complex, unstructured environments. Reinforcement learning can in principle forego the need for explicit state estimation and acquire a policy that directly maps sensor readings to actions, but is difficult to apply to unstable systems that are liable to fail catastrophically during training before an effective policy has been found. We propose to combine MPC with reinforcement learning in the framework of guided policy search, where MPC is used to generate data at training time, under full state observations provided by an instrumented training environment. This data is used to train a deep neural network policy, which is allowed to access only the raw observations from the vehicle's onboard sensors. After training, the neural network policy can successfully control the robot without knowledge of the full state, and at a fraction of the computational cost of MPC. We evaluate our method by learning obstacle avoidance policies for a simulated quadrotor, using simulated onboard sensors and no explicit state estimation at test time.

研究动机与目标

  • 解决为不稳定飞行器训练深度强化学习策略时,探索过程中可能引发灾难性失败的挑战。
  • 通过在训练期间使用MPC作为安全、高质量的监督者,克服传统强化学习的局限性。
  • 使最终策略仅使用原始机载传感器数据(例如IMU、激光测距仪)运行,避免推理阶段进行显式状态估计。
  • 通过训练轻量级、可微的神经网络策略来替代推理阶段计算成本高昂的MPC,实现实时推理。
  • 在无需微调的情况下,展示所学策略在非结构化、未见过的环境(如随机森林和蜿蜒走廊)中的泛化能力。

提出的方法

  • 在训练期间使用在线模型预测控制(MPC)和代理代价函数生成最优动作,利用来自装备有运动捕捉系统的实验环境的完整状态观测。
  • 将当前神经网络策略集成到MPC代价函数中,以鼓励动作一致性,确保策略学习其能够实际执行的动作。
  • 通过监督学习训练深度神经网络策略,使用MPC生成的动作作为目标,且输入仅限于原始机载传感器读数。
  • 将训练(离线、全状态)与推理(机载、仅传感器)解耦,实现在不使智能体暴露于失败风险的情况下,安全、高保真地学习策略。
  • 利用引导策略搜索将强化学习转化为监督学习问题,提升样本效率和收敛稳定性。
  • 应用领域随机化和模型扰动(例如质量偏差、旋翼偏差、参数不确定性)以增强训练期间的策略泛化能力。

实验结果

研究问题

  • RQ1MPC引导的策略搜索是否能够在无灾难性失败的情况下,安全地训练不稳定飞行器的深度神经网络策略?
  • RQ2在仅使用机载传感器输入的情况下,基于MPC生成动作训练的策略是否能泛化到复杂、非结构化的环境?
  • RQ3将当前策略集成到MPC代价函数中是否能提升神经网络训练数据的质量与一致性?
  • RQ4在模型不确定性条件下,该方法与标准强化学习及基线引导策略搜索相比,在鲁棒性和泛化能力方面表现如何?
  • RQ5与推理阶段的完整MPC相比,最终神经网络策略在实时性能和计算成本方面能实现多大程度的降低?

主要发现

  • MPC引导的策略搜索方法在训练期间成功训练了四旋翼飞行器的障碍物规避策略,即使在存在显著模型误差的情况下也未发生任何灾难性失败。
  • 在存在模型不确定性(例如8%的旋翼偏差、3.3%的质量误差以及参数精度降低)的情况下,该方法在无限森林和蜿蜒走廊测试场景中均优于两个基线方法。
  • 在无限森林环境中,最终神经网络策略的平均飞行时间超过100秒;在蜿蜒走廊环境中,平均飞行时间超过80秒,表明其对未见环境具有强大的泛化能力。
  • 所训练的策略能有效泛化到随机圆柱体布置和随机转弯(每5米最多30°)的环境中,表明其对空间变化具有鲁棒性。
  • 最终策略计算效率高,适合机载部署,其计算成本仅为MPC的几分之一,同时保持了高性能。
  • 配备仪器的训练环境实现了安全、高质量的数据采集,利用完整状态反馈,而最终策略在无需状态估计的情况下运行,使其在实际部署中更具实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。