Skip to main content
QUICK REVIEW

[论文解读] Safe end-to-end imitation learning for model predictive control

Keuntaek Lee, Kamil Saigol|arXiv (Cornell University)|Mar 27, 2018
Reinforcement Learning in Robotics参考文献 17被引用 18
一句话总结

本文提出了一种安全的端到端模仿学习框架,用于模型预测控制(MPC),该框架利用贝叶斯卷积神经网络估计预测不确定性,并在不确定性超过学习到的阈值时触发专家干预。通过结合强化学习与模仿学习,该方法可自主学习最优不确定性阈值,无需人工调参,从而在新型或分布外的测试输入下实现视觉控制任务中的鲁棒性能,已在小车载具和自动驾驶仿真环境中得到验证。

ABSTRACT

We propose the use of Bayesian networks, which provide both a mean value and an uncertainty estimate as output, to enhance the safety of learned control policies under circumstances in which a test-time input differs significantly from the training set. Our algorithm combines reinforcement learning and end-to-end imitation learning to simultaneously learn a control policy as well as a threshold over the predictive uncertainty of the learned model, with no hand-tuning required. Corrective action, such as a return of control to the model predictive controller or human expert, is taken when the uncertainty threshold is exceeded. We validate our method on fully-observable and vision-based partially-observable systems using cart-pole and autonomous driving simulations using deep convolutional Bayesian neural networks. We demonstrate that our method is robust to uncertainty resulting from varying system dynamics as well as from partial state observability.

研究动机与目标

  • 解决端到端模仿学习在机器人控制中面临的安全局限性,尤其是在新型或分布外的测试时间输入下。
  • 使自主系统能够检测其预测中的不确定性,并在无需人工调参的情况下启动纠正措施。
  • 结合强化学习与模仿学习,联合学习控制策略与最优不确定性阈值,以实现安全决策。
  • 在真实世界扰动(如未见障碍物)下,于完全可观测与部分可观测(基于视觉)控制任务中验证该框架。
  • 证明贝叶斯深度网络的预测不确定性可作为高速自主系统中安全控制转移的可靠信号。

提出的方法

  • 使用带有蒙特卡洛丢弃的深度贝叶斯卷积神经网络(贝叶斯DNN),输出平均控制动作与预测不确定性估计值。
  • 采用强化学习(RL)组件,学习一个最优不确定性阈值,当不确定性超过该阈值时,触发切换至模型预测控制器(MPC)。
  • 结合模仿学习(通过DAgger风格的数据收集)与强化学习,在批量学习设置中联合训练策略与阈值。
  • 在无需访问状态信息的情况下,将该框架应用于基于原始图像观测的视觉控制,实现部分可观测控制。
  • 使用交叉熵方法(CEM)通过最大化累积奖励与成功率来优化不确定性阈值。
  • 引入一种安全机制:当贝叶斯网络的预测方差超过学习到的阈值时,将控制权转移至专家MPC。

实验结果

研究问题

  • RQ1贝叶斯深度神经网络的预测不确定性是否能可靠指示视觉控制策略在新型测试输入下可能失效的时刻?
  • RQ2强化学习智能体是否能自主学习最优不确定性阈值以实现安全控制,而无需人工调参?
  • RQ3在部分可观测性与新型环境扰动下,该方法在视觉控制MPC任务中的表现如何?
  • RQ4贝叶斯不确定性估计的集成是否能提升高速自主控制任务中的鲁棒性与安全性?
  • RQ5该框架是否能泛化至复杂、类真实世界场景,如存在未见障碍物的自主导航?

主要发现

  • 该方法成功学习到能最大化任务性能与安全性的不确定性阈值,最优阈值通过强化学习自然涌现,无需人工调参。
  • 在小车载具摆动任务中,该框架在不同不确定性阈值下均实现了高成功率与稳定性能,最佳阈值通过CEM优化获得。
  • 在自动驾驶仿真中,当出现新型障碍物时,贝叶斯网络的预测方差显著增加,及时触发了向MPC专家的控制转移。
  • 系统对未见物体类型与颜色变化表现出鲁棒性,但部分情况下对颜色变化仍显敏感,提示需进一步研究。
  • 即使在部分可观测条件下,该框架仍保持了高总奖励与成功率,证实其在视觉控制中的有效性。
  • 利用贝叶斯不确定性作为安全信号,实现了可靠的故障检测与专家接管,显著提升了在分布偏移条件下的系统可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。