Skip to main content
QUICK REVIEW

[論文レビュー] Smart City Transportation: Deep Learning Ensemble Approach for Traffic Accident Detection

Victor Adewopo, Nelly Elsayed|arXiv (Cornell University)|Oct 16, 2023
Traffic Prediction and Management TechniquesEngineering被引用数 3
ひとこと要約

本稿では、スマートシティにおけるリアルタイム交通事故検出を目的として、RGB動画フレームとオプティカルフローを融合する軽量な I3D-CONVLSTM2D モデルを提案する。独自に整備されたデータセットで訓練された本モデルは、87% の平均平均精度(MAP)を達成し、ベースラインを上回る性能を発揮するとともに、Raspberry Pi などのエッジデバイスへのデプロイに最適化されている。

ABSTRACT

The dynamic and unpredictable nature of road traffic necessitates effective accident detection methods for enhancing safety and streamlining traffic management in smart cities. This paper offers a comprehensive exploration study of prevailing accident detection techniques, shedding light on the nuances of other state-of-the-art methodologies while providing a detailed overview of distinct traffic accident types like rear-end collisions, T-bone collisions, and frontal impact accidents. Our novel approach introduces the I3D-CONVLSTM2D model architecture, a lightweight solution tailored explicitly for accident detection in smart city traffic surveillance systems by integrating RGB frames with optical flow information. Our experimental study's empirical analysis underscores our approach's efficacy, with the I3D-CONVLSTM2D RGB + Optical-Flow (Trainable) model outperforming its counterparts, achieving an impressive 87\% Mean Average Precision (MAP). Our findings further elaborate on the challenges posed by data imbalances, particularly when working with a limited number of datasets, road structures, and traffic scenarios. Ultimately, our research illuminates the path towards a sophisticated vision-based accident detection system primed for real-time integration into edge IoT devices within smart urban infrastructures.

研究の動機と目的

  • スマートシティインfraストラクチャにおけるリソース制約のあるエッジ IoT デバイスに適した、リアルタイムかつ計算効率の良い事故検出システムの開発を目的とする。
  • 既存の事故検出データセットにおけるデータの不均衡と多様性の不足に取り組むため、交通映像およびドライブレコーダー映像から特化したベンチマークデータセットを整備する。
  • 新しい深層学習アーキテクチャを用いて、RGB フレームとオプティカルフローの両方から得られる空間時間的特徴を統合することで、検出精度の向上を図る。
  • 静止車両や遅い交通の流れといった、事故に似たイベントと真正の交通事故を区別し、システムのロバスト性を向上させる。
  • I3D ような重いモデルの代替として、リソース制約のあるハードウェアでも実用的な実装が可能な、軽量でトレーニング可能な代替手段を提供すること。

提案手法

  • 提案された I3D-CONVLSTM2D モデルは、3次元畳み込みニューラルネットワーク(I3D)と ConvLSTM2D 層を組み合わせ、動画シーケンスからの空間時間的特徴を抽出する。
  • 本モデルは RGB フレームとオプティカルフロー入力を処理し、特徴統合によって動的な事故関連の動きの検出を強化する。
  • 特徴表現の向上と学習時間の短縮を図るため、Kinetics データセットで事前学習された I3D 重みを転移学習で活用する。
  • RGB とオプティカルフロー入力のための別々のブランチを持つ二重ストリームアーキテクチャを採用し、分類の直前でラテントフェージョンを実施する。
  • 多様な事故タイプ(追突、T字衝突、正面衝突)と道路状況をカバーする 1,000 本以上の動画クリップを含むカスタムデータセットでモデルを訓練した。
  • モデル圧縮技術を用いてエッジデプロイに最適化した推論を実現し、RGB + オプティカルフロー変種の総パラメータ数は 900 万に抑えられた。
Figure 1: Percentage distribution of different types of collision.
Figure 1: Percentage distribution of different types of collision.

実験結果

リサーチクエスチョン

  • RQ1監視カメラからの RGB およびオプティカルフロー入力のみを用いて、軽量な深層学習モデルがリアルタイムに交通事故を効果的に検出できるか。
  • RQ2RGB とオプティカルフローの統合は、単独で使用するいずれのモodal に対しても、事故検出精度をどのように向上させるか。
  • RQ3カスタムで整備されたデータセットは、希少な事故タイプにおけるモデルの汎化性能と性能向上にどの程度寄与するか。
  • RQ4I3D-CONVLSTM2D アーキテクチャは、精度と計算効率の両面で、既存の最先端モデルをどのように上回るか。
  • RQ5本システムの主な失敗モードは何か。また、実世界でのデプロイにおいてそれらをどのように緩和できるか。

主な発見

  • I3D-CONVLSTM2D RGB + オプティカルフロー(トレーニング可能)モデルは、平均平均精度(MAP)が 87% を達成し、他のベースラインモデルを顕著に上回った。
  • モデルは事故イベントの分類において 80% の精度を示したが、トランスフォーマー基盤のバージョンでは、トレーニング時間が長くかかることを除けば、精度、再現率、F1 スコアが 75% であった。
  • パラメータ数がわずか 900 万の軽量アーキテクチャは、2 GPU 環境(1 GPU あたり 11 GB)で効率的にトレーニング可能であり、エッジデプロイに適した性能を示した。
  • 本研究では、静止車両や遅い交通の流れが誤検出の原因となることが判明し、文脈理解の向上が求められることが示された。
  • ほこり、煙、視界不良といった環境要因はモデル性能を低下させることが判明し、耐障害性の強化の必要性が浮き彫りになった。
  • 多様な事故シナリオと道路タイプを含む整備済みデータセットは、トレーニングと汎化に貴重なリソースとなり、今後の研究に役立つことが示された。
Figure 2: Accidents by Intersection Type and Light Condition Associated.
Figure 2: Accidents by Intersection Type and Light Condition Associated.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。