Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Approach for Lane Detection using Google Street View and CNN

Rama Sai Mamidala, Uday Uthkota|arXiv (Cornell University)|Sep 2, 2019
Autonomous Vehicle Technology and Safety参考文献 5被引用数 6
ひとこと要約

本稿では、ウォリングン大学のデータセットから抽出した1,500枚の画像を用いてトレーニングされた、SegNetベースのCNNモデルを用いた動的レーン検出システムを提案する。GoogleストリートビューおよびGoogle APIと統合することで、リアルタイムの位置情報に基づく画像取得が可能となり、遮蔽や照明の変化に対しても96.1%のテスト精度を達成し、ロバストな性能を示した。SVMおよびMLPCベースラインを上回り、リアルタイムナビゲーションが可能なピクセル単位のセマンティックセグメンテーションを実現した。

ABSTRACT

Lane detection algorithms have been the key enablers for a fully-assistive and autonomous navigation systems. In this paper, a novel and pragmatic approach for lane detection is proposed using a convolutional neural network (CNN) model based on SegNet encoder-decoder architecture. The encoder block renders low-resolution feature maps of the input and the decoder block provides pixel-wise classification from the feature maps. The proposed model has been trained over 2000 image data-set and tested against their corresponding ground-truth provided in the data-set for evaluation. To enable real-time navigation, we extend our model's predictions interfacing it with the existing Google APIs evaluating the metrics of the model tuning the hyper-parameters. The novelty of this approach lies in the integration of existing segNet architecture with google APIs. This interface makes it handy for assistive robotic systems. The observed results show that the proposed method is robust under challenging occlusion conditions due to pre-processing involved and gives superior performance when compared to the existing methods.

研究の動機と目的

  • 自律走行を目的とした、位置情報に依存するストリート画像を活用するリアルタイムで動的であるレーン検出システムの開発。
  • 遮蔽、照明が悪い状況、画像の明るさの変動といった困難な条件下でも、ディープラーニングに基づくセマンティックセグメンテーションにより、性能の向上を図ること。
  • トレーニング済みのCNNモデルをGoogle API(ストリートビュー、マップ、ジオロケート)と統合し、リアルタイムでのデータ取得とシステムのデプロイを可能にすること。
  • 従来の機械学習手法(SVM、MLPC)と比較して、レーンセグメンテーションの精度と一般化性能に優れた性能を示すことを実証すること。
  • 将来的な応用、例えば視覚障害者向けの支援ロボットや電子の杖への応用を想定したスケーラビリティの実現。

提案手法

  • ピクセル単位のセマンティックセグメンテーションに、エンコーダ・デコーダアーキテクチャを用いたSegNetを採用。エンコーダが低解像度の特徴マップを抽出し、デコーダが密度のある分類を実行する。
  • 大学のウォリングン大学データセットから抽出した、2,000枚のカスタムデータセット(1,500枚をトレーニング、500枚をテスト)を用い、正解アノテーション付きでモデルをトレーニング。
  • 収束を確保するため、学習率や重み初期化(Xavier)といったハイパーパrameterを最適化。GPUクラスタを用い、SLURMを介してトレーニングを実行。
  • 現在のシステムの位置情報を基に、リアルタイムで位置情報付きの画像を取得するために、GoogleストリートビューAPIおよびジオロケートAPIを活用。これにより、動的入力を可能にする。
  • モデルの評価には、予測されたレーンセグメントと正解との間の平均二乗誤差を用い、精度、再現率、F1スコア、テスト精度といった指標を用いる。
  • トレーニング済みのCNNをGoogle APIとインターフェースすることで、動的に取得されたストリート画像上でリアルタイムの推論を実現し、システムをリアルタイムにデプロイ。

実験結果

リサーチクエスチョン

  • RQ1遮蔽や照明の変化といった実世界の状況下において、SegNetベースのCNNモデルは、従来の機械学習手法と比較して、レーン検出においてどの程度の性能を示すか?
  • RQ2GoogleストリートビューおよびジオロケーションAPIとの統合により、現在地に依存するリアルタイムのストリート画像を用いた、動的レーン検出が可能になるか?
  • RQ3高い精度と収束を達成するための最適なハイパーパrameter設定(例:エポック数、学習率)は何か?
  • RQ4トレーニングデータ量の増加およびGPUベースのトレーニングと併せた場合、モデルの性能(精度、再現率、F1スコア)はどのように変化するか?
  • RQ5本システムは、自律走行における障害物や複数レーンのマルチクラスセグメンテーションをサポートするように、どの程度拡張可能か?

主な発見

  • 1,500枚の画像でトレーニングし、500枚の画像でテストした場合、モデルは96.1%のテスト精度を達成。115エポックでF1スコアは0.9445に達した。
  • 115エポックで精度は0.9889に達したが、再現率は0.4042に低下し、遮蔽状態の画像ではすべての真陽性ピクセルを検出するのが困難であることが示された。
  • CNNベースの手法は、SVMおよびMLPCを著しく上回り、ノイズが少なく、特に遮蔽や低照度状態でも一般化性能に優れた結果を示した。
  • Google APIとの統合により、現在地のストリート画像へのリアルタイムアクセスが可能となり、システムは動的かつ実用的なナビゲーションシナリオに適用可能となった。
  • SLURMを介したGPUクラスタでのトレーニングにより、収束が促進され、時間計算量が削減され、より大きなデータセットでの効率的なトレーニングが可能になった。
  • 実際のGoogleストリートビュー画像において、予測されたレーンセグメントと正解との間に高い相関(約1)が確認され、リアルタイム性能の妥当性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。