Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Traffic-Sign Recognition with Scale-aware CNN

Yuchen Yang, Shuo Liu|arXiv (Cornell University)|May 31, 2018
Hand Gesture Recognition Systems被引用数 11
ひとこと要約

本稿では、スケールに敏感な交通標識認識(TSR)システムを提案する。このシステムは、スケール不変な領域提案を実現する二重マルチスケール畳み込みニューラルネットワーク(FCN)と、マルチスケール特徴抽出を統合した軽量なInceptionベース分類ネットワークを採用している。本手法は、スウェーデン交通標識データセット(STSD)において99.88%の精度と96.61%の再現率を達成し、最先端の手法を上回る性能を発揮するとともに、リソース制限のある車載環境におけるリアルタイム導入に適した高速性と軽量化を実現した。

ABSTRACT

The paper presents a Traffic Sign Recognition (TSR) system, which can fast and accurately recognize traffic signs of different sizes in images. The system consists of two well-designed Convolutional Neural Networks (CNNs), one for region proposals of traffic signs and one for classification of each region. In the proposal CNN, a Fully Convolutional Network (FCN) with a dual multi-scale architecture is proposed to achieve scale invariant detection. In training the proposal network, a modified "Online Hard Example Mining" (OHEM) scheme is adopted to suppress false positives. The classification network fuses multi-scale features as representation and adopts an "Inception" module for efficiency. We evaluate the proposed TSR system and its components with extensive experiments. Our method obtains $99.88\%$ precision and $96.61\%$ recall on the Swedish Traffic Signs Dataset (STSD), higher than state-of-the-art methods. Besides, our system is faster and more lightweight than state-of-the-art deep learning networks for traffic sign recognition.

研究の動機と目的

  • 実際の走行シーンにおけるスケールが異なる交通標識の検出という課題に対処する。特に、小さな標識が見過ごされがちな状況を改善する。
  • 複雑な環境(照明不良や視覚的ごみの多い状況)において、再現率を向上させつつ、誤検出(フォールス・ポジティブ)を最小限に抑える。
  • リソース制限のある車載用組み込みシステムへの導入を可能にするために、計算量とメモリ使用量を低減する。
  • 既存の深層学習ベース手法を上回る精度と推論速度を実現する、軽量で効率的かつ高精度なTSRフレームワークを設計する。

提案手法

  • 小規模な標識を検出するには低レイヤーからの特徴マップ、大規模な標識を検出するには最終レイヤーからの特徴マップを用いる二重マルチスケール畳み込みニューラルネットワーク(DMS-net)を採用する。
  • DMS-netの入力として事前に構築された画像ピラミッドを用いることで、異なる受容 field を持つマルチスケール特徴抽出を可能にする。
  • 領域提案ネットワークの学習段階で誤検出を抑制するために、変更を加えた損失関数とオンラインハード例マイニング(OHEM)方式を統合する。
  • Inceptionモジュールを用いてマルチスケール特徴を統合する軽量な分類ネットワークを設計し、表現学習の性能を向上させる。
  • DMS-netによる領域提案生成と特徴統合ベースの分類ネットワークを統合し、エンドツーエンドで効率的なTSRパイプラインを構築する。
  • 特徴マップの連結とグローバル平均プーリングを適用することで、計算効率を維持したままマルチスケール特徴の統合を実現する。

実験結果

リサーチクエスチョン

  • RQ1二重マルチスケールFCNアーキテクチャは、特に小さな標識や遠く離れた標識を含め、広いスケール範囲で交通標識を効果的に検出できるか?
  • RQ2提案されたOHEMベースの学習スキームは、複雑な道路シーンにおいて再現率を向上させるとともに、誤検出を低減するか?
  • RQ3分類ネットワークにおけるマルチスケール特徴統合は、単一スケール特徴抽出と比較して、認識精度をどの程度向上させるか?
  • RQ4ベンチマークデータセット上での精度、速度、モデル効率性の観点から、本手法は最先端の手法と比較してどの程度優れているか?

主な発見

  • 提案されたスケールに敏感なTSRシステムは、スウェーデン交通標識データセット(STSD)において99.88%の精度と96.61%の平均再現率を達成し、最先端の手法を上回った。
  • DMS-netは300件の提案(AR@300)で平均再現率69.8%を達成し、RPNに比べて小規模および大規模な交通標識の両方で4.6%の向上を示した。
  • アブレーションスタディの結果、小スケールまたは大スケールのブランチを削除すると性能が著しく低下することが確認され、二重ブランチ構造の必要性が裏付けられた。
  • Fusion-net分類器はベースライン手法に比べてmAPを1.87%向上させ、Faster R-CNNに比べて11.67%高いmAPを達成した。
  • 100件程度の限定的な提案数でも高い性能を維持していることから、後段の処理における計算負荷の低減と効率性が示された。
  • 本システム全体は、既存の深層学習ベースTSRネットワークよりも軽量かつ高速であり、リソース制限のある車載用組み込みシステムにおけるリアルタイム導入に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。