Skip to main content
QUICK REVIEW

[論文レビュー] Fast Recurrent Fully Convolutional Networks for Direct Perception in Autonomous Driving

Yiqi Hou, Sascha Hornauer|arXiv (Cornell University)|Nov 17, 2017
Advanced Neural Network Applications参考文献 13被引用数 14
ひとこと要約

本稿では、深く細い完全畳み込み層と再帰ユニットを組み合わせた軽量でエンドツーエンドの深層学習アーキテクチャである Fast Recurrent Fully Convolutional Networks (F-RFCN) を提案する。このアーキテクチャは、最小限のパラメータで動画入力を直接ステアリングおよび加速命令に予測する。F-RFCN は、先行するエンドツーエンドモデルと比較して 3 倍少ないパラメータを実現し、より高速に収束し、より低い損失を達成する。また、優れたロバストネスと一般化性能を示し、実世界のテストトラックにおいて 85% の自律走行率、DAVE-2 ベースラインと比較して 70% 長い故障までの時間、4 倍以上長い故障までの距離を達成した。

ABSTRACT

Deep convolutional neural networks (CNNs) have been shown to perform extremely well at a variety of tasks including subtasks of autonomous driving such as image segmentation and object classification. However, networks designed for these tasks typically require vast quantities of training data and long training periods to converge. We investigate the design rationale behind end-to-end driving network designs by proposing and comparing three small and computationally inexpensive deep end-to-end neural network models that generate driving control signals directly from input images. In contrast to prior work that segments the autonomous driving task, our models take on a novel approach to the autonomous driving problem by utilizing deep and thin Fully Convolutional Nets (FCNs) with recurrent neural nets and low parameter counts to tackle a complex end-to-end regression task predicting both steering and acceleration commands. In addition, we include layers optimized for classification to allow the networks to implicitly learn image semantics. We show that the resulting networks use 3x fewer parameters than the most recent comparable end-to-end driving network and 500x fewer parameters than the AlexNet variations and converge both faster and to lower losses while maintaining robustness against overfitting.

研究の動機と目的

  • 自律走行における直接的認識を実現する計算効率が高く、パラメータ数を削減し、トレーニング時間を短縮しつつも性能を維持するエンドツーエンドの深層ニューラルネットワークの設計。
  • 極めて小さな、深く細い完全畳み込み層と再帰性を持つネットワークが、生動画入力から複雑な制御ポリシーを効果的に学習できるかを調査すること。
  • バッチ正則化、マルチタスク学習、LSTM を用いた時系列モデリングといったアーキテクチャ的選択が、スパースデータ下での収束速度、一般化性能、ロバストネスに与える影響を評価すること。
  • DAVE-2 などの最先端エンドツーエンドモデルと比較し、実世界の走行条件下での F-RFCN アーキテクチャの故障メトリクスおよび未観測シナリオ(例:夜間走行)への一般化性能を評価すること。

提案手法

  • 生動画フレームを直接ステアリングおよび加速命令にマップする、高速再帰的完全畳み込みネットワーク(F-RFCN)の 3 種類のバリエーションを提案する。
  • パラメータ数を削減しつつも空間的特徴抽出能力を保持するため、深く細い完全畳み込み層を採用する。
  • 時系列フレーム間の時間的依存関係をモデル化するため、再帰ユニット(LSTM)を統合し、スパatiotemporal理解を向上させる。
  • 補助分類ヘッドを含めることでマルチタスク学習を実装し、画像の意味的特徴を暗黙的に学習させ、特徴表現を強化する。
  • トレーニングの安定化と勾配の流れの改善のため、バッチ正則化と残差型スキップ接続を採用する。
  • 制御命令の回帰損失と意味理解の分類損失を組み合わせた損失関数を最適化に用いる。

実験結果

リサーチクエスチョン

  • RQ1再帰性を有する小さな、深く細い完全畳み込みネットワークが、先行モデルと比較して顕著に少ないパラメータで、ロバストなエンドツーエンド走行制御を達成できるか?
  • RQ2マルチタスク学習および意味分類ヘッドの導入が、エンドツーエンド走行ネットワークの収束速度と一般化性能に与える影響はいかほどか?
  • RQ3F-RFCN は、夜間走行やスパースデータといった困難な条件下で、より大きなモデルと比較してどの程度一般化性能を示すか?
  • RQ4F-RFCN は、故障までの時間、距離、自律走行率といった実世界走行メトリクスにおいて、DAVE-2 ベースラインを上回るか?

主な発見

  • F-RFCN モデルは、次に小さいエンドツーエンド走行ネットワークと比較して 3 倍少ないパラメータを実現し、AlexNet をベースとするモデルと比較して 500 倍も少ない。収束が早く、最終的な損失も低かった。
  • 実際のテストトラックでの評価では、F-RFCN は 85% の自律走行率を達成した。DAVE-2 ベースラインの 82% と比較して高く、平均故障までの時間は 70% 長く(124 秒 vs. 72.75 秒)なった。
  • F-RFCN は平均して 132.9 メートルの走行距離を達成したが、DAVE-2 モデルの 33.4 メートルと比較して 4 倍以上も長かった。
  • 夜間走行条件下では、F-RFCN はトラックから逸脱しても経路補正を試みるなど、より優れた一般化性能を示した。一方、DAVE-2 モデルは回復できなかった。
  • F-RFCN は、一時的に光を引きつけるような視覚的干渉(例:フラッシュライト)に対しても耐性を示し、初期には反応を示したが、後に経路を是正した。一方、DAVE-2 モデルは光に強く引きつけられ、失敗した。
  • スパースデータでのトレーニングでは、F-RFCN は性能を維持し、収束の安定性を保ち、低データ環境下でも一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。