Skip to main content
QUICK REVIEW

[論文レビュー] Self-Driving Car Steering Angle Prediction: Let Transformer Be a Car Again

Chingis Oinar, Eunmin Kim|arXiv (Cornell University)|Apr 27, 2022
Autonomous Vehicle Technology and Safety被引用数 4
ひとこと要約

本論文は、自己走行車のステアリング角度予測のための新しいTransformerベースのアーキテクチャを提案する。光学フロー特徴量とマルチタスク学習を組み合わせることで、Udacity Self-Driving Car Challenge 2データセットにおいて、プライベートRMSE 0.0577、パブリックRMSE 0.0588を達成し、ベースラインモデルを上回り、コンペティションで3位~4位の順位を獲得した。

ABSTRACT

Self-driving vehicles are expected to be a massive economic influence over the coming decades. Udacity https://www.udacity.com/ has been working on a completely open-source self driving car. Thus, it regularly organizes various competitions, one of which was dedicated to steering angle prediction task. In this work, we perform an extensive study on this particular task by exploring the Udacity Self-driving Car Challenge 2. We provide insights on the previous teams' solutions. Moreover, we propose our new architecture that is inspired by some of the teams. We report our performance and compare it with multiple baseline architectures as well as other teams' solutions. We make our work available on GitHub and hope it is useful for the Udacity community and brings insights for future works https://github.com/chingisooinar/AI_self-driving-car

研究の動機と目的

  • 自動運転におけるステアリング角度予測のための既存のディーブラーニングモデルを改善すること。
  • 標準的なモデルが困難とする極端なステアリング角度の予測という課題に取り組むこと。
  • 注意メカニズムと光学フロー特徴量が、ドライブタスクのシーケンスモデリングにおいてどの程度有効であるかを調査すること。
  • さまざまな走行状況、例えば天候、照明、道路状況の違いに対しても一般化性の高いモデルを開発すること。
  • Udacity Self-Driving Car Challenge 2データセットにおいて、既存のベースラインおよび過去のコンペティション解決策を上回ること。

提案手法

  • RGB画像の特徴抽出にResNet-18を用いたVision Transformer (ViT)バックボーンを採用する。
  • 連続するRGBフレームから導出された光学フロー画像を処理する別々のブランチを導入する。
  • ステアリング角度と車両速度の両方を同時に予測することで、マルチタスク学習を実装する。
  • 一般化を向上させるとともに過学習を軽減するため、ラベルスムージングを0.35の係数で適用する。
  • ステアリング角度予測ヘッドおよび速度予測ヘッドの両方で、平均二乗誤差(MSE)損失関数を用いてモデルを訓練する。
  • データオーグメンテーションとシーケンスモデリングを活用し、フレーム間の時間的依存関係を捉える。

実験結果

リサーチクエスチョン

  • RQ1Transformerベースのアーキテクチャは、CNN-LSTMやResNetベースのモデルを上回ってステアリング角度予測の性能を発揮できるか?
  • RQ2光学フロー特徴量を組み込むことで、極端なステアリング角度の予測性能がどの程度向上するか?
  • RQ3速度予測を伴うマルチタスク学習が、主たるステアリング角度回帰タスクにどの程度寄与するか?
  • RQ4提案モデルにおける注意マップは、標準的なTransformerと比較してより動的かつ文脈に適応した注意を示すか?
  • RQ5ラベルスムージングとアーキテクチャの変更は、未学習のテストデータに対する一般化性能を向上させるか?

主な発見

  • 提案されたTransformerモデルは、プライベートRMSE 0.0577、パブリックRMSE 0.0588を達成し、DAVE2、ResNet50、CNN-LSTMを含むすべてのベースラインモデルを上回った。
  • 光学フローと速度予測ブランチを備えたモデルは、標準モデルと比較して極端なステアリング角度の誤差を低減した。
  • アブレーションスタディの結果、光学フローブランチと速度予測ヘッドの両方が性能向上に顕著に寄与しており、完全なモデルは単純なTransformerよりもプライベートデータで0.0079のRMSE低減を達成した。
  • 注意マップの可視化から、提案モデルは特に動きの境界でフレーム間を動的に注目を移動させているのに対し、標準的なTransformerは静的で一様な注目を示すことが分かった。
  • Udacityチャレンジでは3位または4位にランクインし、転移学習やLSTMベースのアプローチを上回ったが、1位の解法(RMSE 0.0483)には及ばなかった。
  • 0.35の係数で予測値をスムージングすることでさらなる性能向上が見られたことから、一般化性能とノイズのあるラベルに対するロバスト性が向上していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。