Skip to main content
QUICK REVIEW

[論文レビュー] Meta learning Framework for Automated Driving

Ahmad El Sallab, Mahmoud S. R. Saeed|arXiv (Cornell University)|Jun 11, 2017
Reinforcement Learning in Robotics参考文献 19被引用数 8
ひとこと要約

本論文では、複数のトラックにわたる一般的なドライブ特徴を捉えるメタラーナーと、各環境に特化したローレベルラーナーに分けることで、未確認環境間での一般化を向上させるメタラーニングフレームワーク、MetaDAggerを提案する。MetaDAggerは、1回のデータ集約イテレーション後にラップの80%を完了するなど、優れたサンプル効率と高速学習を達成し、トレーニングおよび未確認のテストトラックにおいてDAggerを上回る性能を発揮する。

ABSTRACT

The success of automated driving deployment is highly depending on the ability to develop an efficient and safe driving policy. The problem is well formulated under the framework of optimal control as a cost optimization problem. Model based solutions using traditional planning are efficient, but require the knowledge of the environment model. On the other hand, model free solutions suffer sample inefficiency and require too many interactions with the environment, which is infeasible in practice. Methods under the Reinforcement Learning framework usually require the notion of a reward function, which is not available in the real world. Imitation learning helps in improving sample efficiency by introducing prior knowledge obtained from the demonstrated behavior, on the risk of exact behavior cloning without generalizing to unseen environments. In this paper we propose a Meta learning framework, based on data set aggregation, to improve generalization of imitation learning algorithms. Under the proposed framework, we propose MetaDAgger, a novel algorithm which tackles the generalization issues in traditional imitation learning. We use The Open Race Car Simulator (TORCS) to test our algorithm. Results on unseen test tracks show significant improvement over traditional imitation learning algorithms, improving the learning time and sample efficiency in the same time. The results are also supported by visualization of the learnt features to prove generalization of the captured details.

研究の動機と目的

  • 自律走行における模倣学習の一般化ギャップを解消すること、特に未確認環境でモデルが失敗する問題に取り組む。
  • ポリシー学習におけるサンプル効率を向上させ、有効なトレーニングに必要な環境との相互作用回数を削減すること。
  • 報酬関数への依存を最小限に抑え、危険な相互作用を減らすことで、実世界への展開を可能にすること。
  • 多様な環境にわたる一般的なドライブ特徴を捉えるメタラーニングフレームワークを開発すること。
  • 学習された特徴が、環境固有の特徴(例:地形や水平線の詳細)ではなく、タスク関連の特徴(例:レーン位置)であることを検証すること。

提案手法

  • フレームワークはメタラーナーとローレベルラーナーに分離され、メタラーナーが複数の環境にわたる一般的な特徴を捉え、ローレベルラーナーが各環境に特化する。
  • データ集約は、DAggerに類似した方法で反復的に行われ、ローレベルエージェントの誤りが是正され、メタラーナーにフィードバックされる。
  • 継続的で生涯にわたる学習により、環境切り替え時にローレベルラーナーが新しい経験をメタラーナーに更新する。
  • メタラーナーとローレベルラーナーの両方で、同一のConvNetを用い、バッチ正規化、Xavier初期化、ドロップアウト、ReLU、回帰用の線形出力を使用する。
  • 損失関数は、連続的ステアリング操作の回帰にMSE(平均二乗誤差)を用いる。
  • 特徴の可視化にはGrad-CAMが用いられ、学習された表現の一般性を分析・検証する。

実験結果

リサーチクエスチョン

  • RQ1メタラーニングは、未確認環境間での自律走行における模倣学習の一般化を向上させ得るか?
  • RQ2提案されたMetaDAggerフレームワークは、従来のDAggerと比較して、サンプル複雑性を低減するか?
  • RQ3MetaDAggerが学習する特徴は、環境固有の特徴(例:地形や空の様子)よりも、タスク関連の特徴(例:レーンマーク)に近いか?
  • RQ4トレーニングデータに過剰適合することなく、多様なドライブトラック間で知識を効果的に転送できるか?
  • RQ5フレームワークは、未確認のテストトラックにおいて、より高速な収束と高いパフォーマンスを達成できるか?

主な発見

  • MetaDAggerは、たった1回のデータ集約イテレーション後にはすでにラップの80%を完了し、初期学習段階でDAggerを顕著に上回った。
  • 未確認のテストトラックでは、MetaDAggerは0または1回のイテレーションでほとんどすべてのラップを完了したが、DAggerは同程度の進捗を得るまでに最大4回のイテレーションを要した。
  • Grad-CAMの可視化により、MetaDAggerがレーンマークのようなタスク関連の特徴を学習していることが確認されたのに対し、DAggerは山や水平線のような環境固有の手がかりに注目していた。
  • MetaDAggerは、すべてのテストトラックでDAggerよりも優れた一般化性能とサンプル効率を達成し、より少ないイテレーションでより多くのラップを完了した。
  • メタラーナーは、多様なトラックにわたる一貫したパフォーマンスと特徴可視化の結果から、環境にわたる一般的なドライブ特徴を効果的に捉えていたことが裏付けられた。
  • 効率的なデータ収集と是正により、危険な相互作用を最小限に抑えることで、実世界への展開の可能性が顕著に示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。