Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Steer by Mimicking Features from Heterogeneous Auxiliary Networks

Yuenan Hou, Zheng Ma|arXiv (Cornell University)|Nov 7, 2018
Autonomous Vehicle Technology and Safety参考文献 27被引用数 13
ひとこと要約

本論文は、事前学習済みの汎用ネットワーク(例:セマンティックセグメンテーション用のPSPNet、光流用のFlowNet2)からマルチレイヤー特徴を蒸留することで、ターゲットデータセットにおけるタスク固有のアノテーションを必要とせずに、エンドツーエンドのステアリング角度予測を向上させる、異種の補助ネットワーク特徴模倣と呼ばれる新しいトレーニング手法を提案する。この手法は、UdacityおよびComma.aiベンチマークで最先端の性能を達成し、先行手法と比較してそれぞれ12.8%および52.1%の平均絶対誤差の低減を実現した。

ABSTRACT

The training of many existing end-to-end steering angle prediction models heavily relies on steering angles as the supervisory signal. Without learning from much richer contexts, these methods are susceptible to the presence of sharp road curves, challenging traffic conditions, strong shadows, and severe lighting changes. In this paper, we considerably improve the accuracy and robustness of predictions through heterogeneous auxiliary networks feature mimicking, a new and effective training method that provides us with much richer contextual signals apart from steering direction. Specifically, we train our steering angle predictive model by distilling multi-layer knowledge from multiple heterogeneous auxiliary networks that perform related but different tasks, e.g., image segmentation or optical flow estimation. As opposed to multi-task learning, our method does not require expensive annotations of related tasks on the target set. This is made possible by applying contemporary off-the-shelf networks on the target set and mimicking their features in different layers after transformation. The auxiliary networks are discarded after training without affecting the runtime efficiency of our model. Our approach achieves a new state-of-the-art on Udacity and Comma.ai, outperforming the previous best by a large margin of 12.8% and 52.1%, respectively. Encouraging results are also shown on Berkeley Deep Drive (BDD) dataset.

研究の動機と目的

  • ステアリング角度の監視のみに依存するエンドツーエンドのステアリング角度予測モデルにおける文脈理解の限界を解消すること。
  • 急カーブ、強い影、照明の変化といった困難な走行状況におけるモデルのロバスト性を向上させること。
  • ターゲットデータセットにおける高価なアノテーションを必要とせずに、補助ネットワークから豊富な文脈信号を活用するトレーニング手法を開発すること。
  • 複数の異種ネットワークの複数レイヤーで得られる特徴を模倣することで、メインモデルが多様なシーン構造と動きの手がかりを学習できること。
  • 推論コストを増加させることなく、ベンチマークデータセットで最先端の性能を達成すること。

提案手法

  • 本手法は、同じ入力画像に対して、セマンティックセグメンテーション用のPSPNetと光流推定用のFlowNet2という異種の補助ネットワークから得られる深層特徴を、メインのステアリングネットワーク(FM-Net)が模倣する形でトレーニングする。
  • 特徴模倣は、補助ネットワークの低層、中層、高層の複数のレイヤーに適用され、メインネットワークがこれらのレイヤーの活性化パターンを再現するように最適化される。
  • 補助ネットワークはトレーニング時のみに使用され、推論時には破棄されるため、実行時オーバーヘッドが生じない。
  • 本手法は知識蒸留の原則を応用するが、最終出力のログィットだけでなく、異種ネットワークおよび複数の特徴レイヤーに跨る蒸留を実施する。
  • メインネットワークは、各レイヤーにおける予測特徴マップとターゲット特徴マップのL2距離を最小化する多段階特徴マッチング損失により最適化される。
  • 補助ネットワークをターゲットドメインのデータに直接適用することで、異なるデータセットで事前学習するのを避け、ドメインシフトの問題を回避する。

実験結果

リサーチクエスチョン

  • RQ1異種の補助ネットワークからの特徴模倣は、ステアリング角度監視のみに依存するモデルよりも、エンドツーエンドのステアリング角度予測を向上させることができるか?
  • RQ2異なるタスク(例:セグメンテーションと光流)を実行するネットワークからのマルチレイヤー特徴蒸留は、単一タスクの監視よりもよりロバストで正確な予測を提供するか?
  • RQ3微調整なしの関連タスク(例:画像セグメンテーション)における従来の事前学習と比較して、特徴模倣の性能はどのように異なるか?
  • RQ4補助ネットワークからの低層、中層、高層特徴のそれぞれが最終予測精度に与える相対的寄与度はどの程度か?
  • RQ5複数の補助ネットワークからの特徴模倣を組み合わせることで、単一のネットワークを用いる場合よりも高い性能が得られるか?

主な発見

  • 提案手法はUdacityベンチマークで新たな最先端性能を達成し、リーダーボード上位の「komanda」と比較して平均絶対誤差を12.8%低減した。
  • Comma.aiベンチマークでは、前回最良手法と比較して平均絶対誤差が52.1%改善された。
  • PSPNetとFlowNet2を両方の補助ネットワークとして用い、低層・中層・高層の多段階模倣を実施した場合が最も高い性能を示し、シーン構造と動きの手がかりが相補的に寄与していることが示された。
  • 高層特徴の模倣が最も顕著な向上をもたらしたが、低層特徴の模倣も中層特徴の模倣よりも寄与度が高かった。
  • Cityscapesで事前学習した単純な戦略と比較して、本手法は大幅に優れており、ターゲットデータ上で直接特徴をマッチングすることが、ドメインシフトを伴う事前学習よりも効果的であることが示唆された。
  • アブレーションスタディにより、補助ネットワークはトレーニング時のみに必要であり、推論効率に影響を与えないことが確認され、リアルタイムデプロイの可能性が維持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。