Skip to main content
QUICK REVIEW

[論文レビュー] Action-Based Representation Learning for Autonomous Driving

Yi Xiao, Felipe Codevilla|arXiv (Cornell University)|Aug 21, 2020
Gaussian Processes and Bayesian Inference参考文献 40被引用数 5
ひとこと要約

本論文は、逆運動学、順運動学、行動コーピングを活用して、専門家のデモンストレーションから分離可能な視覚的表現を学ぶ、アクションベースの表現学習フレームワークを提案する。専門家データ上で表現モデルを事前学習し、アフォーダンス予測のためのファインチューニングを行うことで、特に赤色の信号で停止するタスクにおいて、エンドツーエンドの模倣学習を著しく上回る性能を達成した。

ABSTRACT

Human drivers produce a vast amount of data which could, in principle, be used to improve autonomous driving systems. Unfortunately, seemingly straightforward approaches for creating end-to-end driving models that map sensor data directly into driving actions are problematic in terms of interpretability, and typically have significant difficulty dealing with spurious correlations. Alternatively, we propose to use this kind of action-based driving data for learning representations. Our experiments show that an affordance-based driving model pre-trained with this approach can leverage a relatively small amount of weakly annotated imagery and outperform pure end-to-end driving models, while being more interpretable. Further, we demonstrate how this strategy outperforms previous methods based on learning inverse dynamics models as well as other methods based on heavy human supervision (ImageNet).

研究の動機と目的

  • 専門家のデモンストレーションからのアクションベースの監視を活用して、自律走行のための視覚的表現学習を改善すること。
  • エンドツーエンドの模倣学習と比較して、専門家データ上で事前学習することで、下流のアフォーダンス予測および走行性能が向上するかを調査すること。
  • CARLA 0.9.6を用いて、歩行者および車両の動的挙動を強化した、信頼性の高いベンチマークを構築すること。
  • 逆モデル、順モデル、行動コーピングといった、さまざまな自己教師あり学習目的が走行表現学習に与える影響を評価すること。
  • 事前学習済み表現を用いたアフォーダンスベースの制御が、赤信号での停止といった安全に重要なシナリオにおいて、走行性能を著しく向上させることを示すこと。

提案手法

  • 画像観測値、速度、ハイレベルな命令を処理するためのResNet-34エンコーダーを用い、特徴量を連結して共有ヘッドおよびタスク固有のヘッドで処理する。
  • 3つの自己教師あり学習目的を採用する:逆運動学(状態遷移からアクションを予測)、順運動学(アクションから将来の状態を予測)、行動コーピング(状態からアクションを予測)。
  • 別個のアフォーダンス予測ネットワーク $ g_{ heta} $ を訓練し、バイナリアフォーダンス(歩行者、車両、赤信号)および相対ステアリング角度を予測する。
  • PIDベースのコントローラーが予測されたアフォーダンスを用いてステアリング、スロットル、ブレーキ命令を生成し、危険状態検出時にブレーキを発動する。
  • 線形プローブを用いたファインチューニングを行い、CARLA 0.9.6で更新された歩行者および車両の動的挙動を反映した変更済みNoCrashベンチマークで評価する。
  • 行動コーピングエンコーダーを用いた事前学習戦略を採用し、エンドツーエンド学習よりも一般化性能が向上することを確認した。

実験結果

リサーチクエスチョン

  • RQ1専門家のデモンストレーション上で表現モデルを事前学習することで、エンドツーエンドの模倣学習と比較して、アフォーダンス予測および下流の走行性能が向上するか?
  • RQ2逆モデル、順モデル、行動コーピングといった、さまざまな自己教師あり学習目的が、自律走行のための有用な視覚的表現を学ぶ上で、どのように比較されるか?
  • RQ3事前学習済み表現を用いたアフォーダンスベースの制御は、赤信号での停止といった安全に重要なシナリオで、より優れた性能を達成できるか?
  • RQ4歩行者および車両の動的挙動が強化されたCARLA 0.9.6の新しいベンチマークは、走行ポリシーの評価にどのように影響を与えるか?
  • RQ5専門家のデモンストレーションを用いた事前学習と、ランダムポリシーのデータを用いた事前学習のどちらが、走行ポリシーの一般化および耐性に与える影響が大きいのか?

主な発見

  • 行動コーピングによる事前学習は、エンドツーエンドの行動コーピングを著しく上回り、通常のNoCrashベンチマークで91%の成功率、密度の高いシナリオで68%を達成した。一方、エンドツーエンド学習ではそれぞれ47%および20%であった。
  • 逆モデルはナビゲーション操作の予測において最高の性能を示し、左折の平均絶対誤差(MAE)は0.17°であった。これに対して、行動コーピングは3.76°、専門家データを用いた逆モデルは2.03°であった。
  • 逆モデルによる事前学習を用いた場合、赤信号の検出で89%のF1スコアを達成し、他の手法(行動コーピング:86%、順モデル:60%)を著しく上回った。
  • 新しい町の設定では、事前学習戦略が通常シナリオで83%、密度の高いシナリオで25%の成功率を示した。一方、エンドツーエンド学習ではそれぞれ71%および12%であった。一般化性能の向上が確認された。
  • 密度の高いシナリオにおいて、専門家のデモンストレーションを用いた事前学習により、赤信号での停止成功率が90%に達した。一方、エンドツーエンドの行動コーピングではたった8%であった。
  • 線形プローブの結果、逆モデルによる事前学習は左折のMAEが最小(0.17°)であり、赤信号検出のF1スコアが最大(89%)であった。これは、優れた表現品質を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。