Skip to main content
QUICK REVIEW

[論文レビュー] Safe end-to-end imitation learning for model predictive control

Keuntaek Lee, Kamil Saigol|arXiv (Cornell University)|Mar 27, 2018
Reinforcement Learning in Robotics参考文献 17被引用数 18
ひとこと要約

本稿では、予測不確実性を推定し、不確実性が学習されたしきい値を超過した際にエキスパート介入をトリガーするため、ベイジアン畳み込みニューラルネットワークを用いた、安全でエンド・ツー・エンドの模倣学習フレームワークを提案する。強化学習と模倣学習を組み合わせることで、手動のチューニングを必要とせず、最適な不確実性しきい値を自動で学習可能であり、新しい入力や分布外のテスト入力下でも視覚ベースの制御において頑健な性能を発揮することが、カート・ポールと自動運転シミュレーションで検証された。

ABSTRACT

We propose the use of Bayesian networks, which provide both a mean value and an uncertainty estimate as output, to enhance the safety of learned control policies under circumstances in which a test-time input differs significantly from the training set. Our algorithm combines reinforcement learning and end-to-end imitation learning to simultaneously learn a control policy as well as a threshold over the predictive uncertainty of the learned model, with no hand-tuning required. Corrective action, such as a return of control to the model predictive controller or human expert, is taken when the uncertainty threshold is exceeded. We validate our method on fully-observable and vision-based partially-observable systems using cart-pole and autonomous driving simulations using deep convolutional Bayesian neural networks. We demonstrate that our method is robust to uncertainty resulting from varying system dynamics as well as from partial state observability.

研究の動機と目的

  • エンド・ツー・エンドの模倣学習における安全性の制限を、特に新しい入力や分布外のテスト時入力下で解消すること。
  • 自律システムが予測の不確実性を検出し、手動のチューニングなしに是正行動を開始できることを可能にすること。
  • 強化学習と模倣学習を組み合わせ、安全な意思決定のための制御方策と最適な不確実性しきい値を同時に学習すること。
  • 実世界の摂動(未知の障害物など)下で、完全観測可能かつ部分観測可能(視覚ベース)な制御タスクにおいて、フレームワークを検証すること。
  • ベイジアンディープネットワークからの予測不確実性が、高速な自律システムにおける安全な制御移管の信頼できるシグナルとして機能できることを示すこと。

提案手法

  • モンテカルロドロップアウトを用いたベイジアン畳み込みニューラルネットワーク(ベイジアンDNN)を用い、平均的な制御行動と予測不確実性推定値を出力する。
  • 不確実性がしきい値を超えた際にモデル予測制御(MPC)に切り替わるよう、最適な不確実性しきい値を学習する強化学習(RL)モジュールを採用する。
  • DAggerスタイルのデータ収集を用いた模倣学習と強化学習を組み合わせ、バッチ学習環境下で制御方策としきい値を同時に学習する。
  • 状態情報へのアクセスなしに、生の画像観測値を用いた視覚ベースの制御にフレームワークを適用し、部分観測制御を可能にする。
  • 累積報酬と成功確率を最大化するように、不確実性しきい値を最適化するために、交差エントロピー法(CEM)を用いる。
  • ベイジアンネットワークの予測分散が学習されたしきい値を超えた場合に、制御がエキスパートMPCに移行する安全メカニズムを導入する。

実験結果

リサーチクエスチョン

  • RQ1ベイジアンディープニューラルネットワークからの予測不確実性は、新しいテスト入力下で視覚ベースの制御方策が失敗する可能性があることを信頼性高く示唆できるか?
  • RQ2強化学習エージェントは、手動のチューニングなしに、安全な制御のための最適な不確実性しきい値を自動で学習できるか?
  • RQ3本手法は、部分観測と新しい環境的摂動下での視覚ベースのMPCタスクでどのように性能を発揮するか?
  • RQ4ベイジアン不確実性推定の統合は、高速な自律制御タスクにおける頑健性と安全性を向上させるか?
  • RQ5本フレームワークは、未知の障害物を伴う自律走行のような複雑で現実に近いシナリオに一般化可能か?

主な発見

  • 最適なしきい値は、手動のチューニングを必要とせず、RLによって自然に出現し、タスクの性能と安全性を最大化する。
  • カート・ポールのスイングアップタスクでは、さまざまな不確実性しきい値下で高い成功確率と安定した性能を達成し、CEM最適化によって最良のしきい値が特定された。
  • 自動運転シミュレーションでは、未知の障害物が出現した際、ベイジアンネットワークの予測分散が顕著に上昇し、MPCエキスパートへの制御移管が適切にトリガーされた。
  • 未知の物体タイプや色の変化に対しても頑健であったが、一部のケースで色に敏感な反応が観察されたため、さらなる調査が必要であることが示唆された。
  • 部分観測下でも高い総報酬と成功確率を維持したため、視覚ベースの制御において有効であることが確認された。
  • ベイジアン不確実性を安全シグナルとして用いることで、分布シフト下でも信頼性の高い障害検出とエキスパートの制御移管が可能となり、システムの信頼性が著しく向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。