Skip to main content
QUICK REVIEW

[論文レビュー] TAD: A Large-Scale Benchmark for Traffic Accidents Detection from Video Surveillance

Yajun Xu, Chuwen Huang|arXiv (Cornell University)|Sep 26, 2022
Advanced Neural Network Applications被引用数 9
ひとこと要約

本稿では、実際の監視カメラから収集した映像を対象として、高速道路の事故に特化した大規模でオープンソースのベンチマークデータセットTADを紹介する。このデータセットは、画像分類、物体検出、動画分類のタスクを通じて、動画ベースの事故検出の包括的評価を可能にし、時間的モデリングの優位性から動画レベルのモデルが画像レベルの手法を上回ることを示している。特に、SlowFast-ResNet50は動画レベル分類でF1スコア0.680を達成した。

ABSTRACT

Automatic traffic accidents detection has appealed to the machine vision community due to its implications on the development of autonomous intelligent transportation systems (ITS) and importance to traffic safety. Most previous studies on efficient analysis and prediction of traffic accidents, however, have used small-scale datasets with limited coverage, which limits their effect and applicability. Existing datasets in traffic accidents are either small-scale, not from surveillance cameras, not open-sourced, or not built for freeway scenes. Since accidents happened in freeways tend to cause serious damage and are too fast to catch the spot. An open-sourced datasets targeting on freeway traffic accidents collected from surveillance cameras is in great need and of practical importance. In order to help the vision community address these shortcomings, we endeavor to collect video data of real traffic accidents that covered abundant scenes. After integration and annotation by various dimensions, a large-scale traffic accidents dataset named TAD is proposed in this work. Various experiments on image classification, object detection, and video classification tasks, using public mainstream vision algorithms or frameworks are conducted in this work to demonstrate performance of different methods. The proposed dataset together with the experimental results are presented as a new benchmark to improve computer vision research, especially in ITS.

研究の動機と目的

  • 高速道路の事故に特化した大規模でオープンソースの監視映像ベースのデータセットが不足しているという問題に対処すること。
  • 複数のビジョンタスクにわたる事故検出アルゴリズムの評価を可能にする包括的ベンチマークを提供すること。
  • 多様な事故タイプ、シーン、環境的条件を含めることで、モデルの一般化性能を向上させること。
  • 耐障害性が高く、現実世界に適用可能な知的輸送システム(ITS)の開発を支援すること。
  • 順序付きの動画データを活用することで、事故検出における時間的モデリングに関する研究を促進すること。

提案手法

  • 多様な高速道路環境におけるCCTV監視システムから実際の交通事故映像を収集すること。
  • 事故タイプ、関与する物体、空間的・時間的境界を含む複数のラベルを映像に付与すること。
  • 12種類の異なる事故カテゴリ(衝突、転覆、歩行者・自転車関与事故など)をカバーする1,000本以上の動画を含む大規模データセットの構築。
  • 画像分類、物体検出、動画分類タスクに、主流の深層学習モデル(ResNet50、YOLOv5m、SlowFast-ResNet50)を適用すること。
  • 画像レベルおよび動画レベルのタスクにおいて、標準的な指標(再現率、適合率、F1スコア)を用いてモデルの評価を行うこと。
  • フレームレベルの予測を時間的に集約することで、動きや順序のダイナミクスをモデリングし、事故検出の性能を向上させること。

実験結果

リサーチクエスチョン

  • RQ1実際の監視映像から得た大規模でオープンソースのデータセットは、交通事故検出モデルの一般化性能と耐障害性を向上させることができるか?
  • RQ2動画レベル分類における時間的モデリングは、静的画像レベル分類に比べて、事故検出においてどのように優れているのか?
  • RQ3画像分類、物体検出、動画分類の各モデルは、事故検出タスクにおいて、どのように性能に差を示すのか?
  • RQ4なぜ『衝突』や『被害者』といった特定の事故タイプが、検出モデルにおいて高い誤検出率を示すのか?
  • RQ5順序付きの動画情報を取り入れることで、事故認識の正確性と安定性はどの程度向上するのか?

主な発見

  • SlowFast-ResNet50を用いた動画レベル分類は、時間的ダイナミクスをより効果的に活用できたため、画像レベル分類(F1スコア:0.454)を上回り、F1スコア0.680を達成した。
  • YOLOv5mを用いた物体検出では、再現率が0.997に達したが、適合率は0.487にとどまり、フレーム単位の検出に不安定さと高い偽陽性率が見られた。
  • 画像レベルの検出モデルは、分類タスクと比較して顕著に低い再現率(0.261)を示しており、動画フレーム間での事故の局所化に不安定さが生じていることが明らかになった。
  • 複数の動画フレームにわたる予測を統合することで、事故検出性能が顕著に向上した。これは、一貫した時間的パターンが実際の事故を示すより信頼できる指標であることを示している。
  • 『衝突』と『被害者』のカテゴリが、全体の精度を著しく低下させる主な要因であり、微細または複雑な事故状況を区別する困難さが示された。
  • TADは、複数車両衝突、歩行者衝突、転覆など、多様な事故タイプをカバーしており、既存のデータセットと比較してより豊富な視覚的・文脈的特徴を提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。