Skip to main content
QUICK REVIEW

[論文レビュー] Vehicle Shape and Color Classification Using Convolutional Neural Network

Mohamed Nafzi, Michael Brauckmann|arXiv (Cornell University)|May 15, 2019
Video Surveillance and Tracking Methods参考文献 7被引用数 6
ひとこと要約

本論文は、畳み込みニューラルネットワーク(CNN)を用いた深層学習ベースの車両再識別システムを提案する。このシステムは、同時に車種(メーカー/モデル)と色の分類を実行する。大規模で、半自動的にアノテートされたデータセット(1,447の車種モデル、137のメーカー)を活用し、CPU上で97.96%の色分類精度と20msの推論時間を達成。制御環境および実世界の動画データの両方で優れた性能を示した。

ABSTRACT

This paper presents a module of vehicle reidentification based on make/model and color classification. It could be used by the Automated Vehicular Surveillance (AVS) or by the fast analysis of video data. Many of problems, that are related to this topic, had to be addressed. In order to facilitate and accelerate the progress in this subject, we will present our way to collect and to label a large scale data set. We used deeper neural networks in our training. They showed a good classification accuracy. We show the results of make/model and color classification on controlled and video data set. We demonstrate with the help of a developed application the re-identification of vehicles on video images based on make/model and color classification. This work was partially funded under the grant.

研究の動機と目的

  • 実世界の動画監視環境における大規模な車両メーカー/モデルおよび色の分類の課題に対処すること。
  • 1,447のモデルと137のメーカーを含む、大幅に拡大されたデータセットで学習することで、先行研究の限界を克服し、より広範な商業的応用を可能にすること。
  • 希少または珍しい車両モデルの学習を支援するため、スケーラブルで半自動化されたデータ収集およびラベリングパイプラインを構築すること。
  • 自動車監視システム(AVS)におけるリアルタイム導入を想定し、高い精度と低遅延の推論を達成すること。
  • エンド・ツー・エンドの再識別を通じて、低解像度、部分的遮断、変則的視点の動画データに対しても、頑健な性能を示すこと。

提案手法

  • 収束性と分類精度の向上を目的に、Z正規化とELU活性化関数を適用した変更版Inception-Netアーキテクチャを採用した。
  • 10種類の事前定義色クラスを用いたResNetベースのCNNを色分類に適用し、照明条件や画像品質の変動に強く対応するように最適化した。
  • データキュレーションを加速するために、ウェブクロールド画像と品質フィルタリング、手動検証を組み合わせた半自動ラベリングツールを活用した。
  • 低品質な動画入力を模擬し一般化性能を向上させるために、画像のぼかしとダウンスケーリングによるデータ拡張を実施した。
  • バックプロパゲーション中に予測誤差を最小化するため、マルチクラス分類にSoftmax出力と交差エントロピー損失を適用した。
  • 標準版と変更版Inceptionの2つのCNNアーキテクチャからの予測を統合することで、高品質および低品質データの両方に対してより高い頑健性を実現した。

実験結果

リサーチクエスチョン

  • RQ1深層CNNベースのシステムは、多様な視点や画像品質の下でも、車両メーカー/モデルの分類において高い精度を達成できるか?
  • RQ2制御環境データセットと比較して、低解像度および遮断状態の動画データにおけるメーカー/モデル分類の性能低下はどの程度か?
  • RQ3半自動化されたデータパイプラインは、1,447以上の車両モデルと137のメーカーをカバーするのに効果的にスケーラブルか?実用的導入を可能にするか?
  • RQ4本手法の色分類器は、Stanfordなどの標準ベンチマークにおいて、先行研究と比較して精度と推論速度の両面で優れているか?
  • RQ5形状(メーカー/モデル)と色の同時分類により、実世界の動画シーケンスにおいて、信頼性の高い車両再識別がどの程度可能か?

主な発見

  • メーカー/モデル分類器は、Stanfordの色ベンチマークで97.96%の精度を達成し、先行研究(94.47%)を上回り、CPU上での100倍の高速化(20ms 対 3.248s)を実現した。
  • 2つのCNNアーキテクチャの予測を統合することで、高品質データでは8%、低品質データでは14.2%の残差誤差低減が達成され、より高い頑健性が実証された。
  • 1つのCPUコア(i7-4790)で1枚の画像あたり20msの推論時間を達成し、動画監視応用におけるリアルタイム処理を可能にした。
  • 色分類は動画データにおいて高い頑健性を示し、照明の変動、低解像度、部分的遮断に対しても強力な性能を維持した。
  • 実動画シーケンスにおいても、異なる視点や条件下でも、メーカー/モデルおよび色に基づいて車両を的確に再識別できた。
  • 視覚的に類似したモデル(例:ルノー・クレオとダチャ・ロガン)に対しても、システムは高い精度を維持した。これは、形状と色からの強力な特徴抽出が実現していることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。