Skip to main content
QUICK REVIEW

[論文レビュー] TYolov5: A Temporal Yolov5 Detector Based on Quasi-Recurrent Neural Networks for Real-Time Handgun Detection in Video

Mario Alberto Duran-Vega, Miguel González-Mendoza|arXiv (Cornell University)|Nov 16, 2021
Anomaly Detection Techniques and Applications被引用数 5
ひとこと要約

本論文は、動画内の空間的・時間的特徴を活用するため、Quasi-Recurrent Neural Networks (QRNNs) を組み込んだリアルタイム時間的ハンドガン検出システムである TYolov5 を提案する。YOLOv5 に QRNN を統合し、マルチスケール特徴マップに時間的特徴を統合することで、Mosaic および Mixup の時間的データ拡張を適用した結果、YOLOv5 や ConvLSTM を用いたモデルと比較して、推論速度が向上し、mAP 50:95 が最大 60.2 まで向上した。小型・中型・大型アーキテクチャのすべてでリアルタイム性能を維持した。

ABSTRACT

Timely handgun detection is a crucial problem to improve public safety; nevertheless, the effectiveness of many surveillance systems still depends of finite human attention. Much of the previous research on handgun detection is based on static image detectors, leaving aside valuable temporal information that could be used to improve object detection in videos. To improve the performance of surveillance systems, a real-time temporal handgun detection system should be built. Using Temporal Yolov5, an architecture based on Quasi-Recurrent Neural Networks, temporal information is extracted from video to improve the results of handgun detection. Moreover, two publicly available datasets are proposed, labeled with hands, guns, and phones. One containing 2199 static images to train static detectors, and another with 5960 frames of videos to train temporal modules. Additionally, we explore two temporal data augmentation techniques based on Mosaic and Mixup. The resulting systems are three temporal architectures: one focused in reducing inference with a mAP$_{50:95}$ of 55.9, another in having a good balance between inference and accuracy with a mAP$_{50:95}$ of 59, and a last one specialized in accuracy with a mAP$_{50:95}$ of 60.2. Temporal Yolov5 achieves real-time detection in the small and medium architectures. Moreover, it takes advantage of temporal features contained in videos to perform better than Yolov5 in our temporal dataset, making TYolov5 suitable for real-world applications. The source code is publicly available at https://github.com/MarioDuran/TYolov5.

研究の動機と目的

  • 動画監視において時間的文脈を無視する静的画像ベースのハンドガン検出器の限界を解決すること。
  • 順序付き動画情報を利用することで精度を向上させるリアルタイム時間的オブジェクト検出システムを開発すること。
  • ConvLSTM と比較して、Quasi-Recurrent Neural Networks (QRNNs) が時間的オブジェクト検出に与える有効性を評価すること。
  • ハンド、ガン、電話をラベル付けした2つの公開データセット(HGP:2199枚の静的画像、THGP:5960フレームの動画)を導入すること。
  • 時間的データ拡張技術(時間的 Mosaic および Mixup)の有効性を検討・検証し、特徴マップの空間的・時間的性能を向上させること。

提案手法

  • YOLOv5 のマルチスケール特徴マップに QRNN モジュールを統合し、フレーム間をまたがる時間的特徴を抽出・伝搬する。
  • 畳み込み層を用いた準再帰的プーリング機構を採用することで、標準的な RNN よりも並列処理が可能となり、学習・推論が高速化される。
  • Mosaic および Mixup の手法を動画シーケンスに拡張して時間的データ拡張を実施し、モデルの複雑さを増さずに汎化性能を向上させる。
  • 混合精度およびフル精度推論を用い、200エポックにわたり HGP および THGP の混合データセットを用いて、小型・中型・大型アーキテクチャを訓練・評価する。
  • mAP 50:95、推論速度(FPS)、パラメータ効率の観点から、QRNN を用いたモデルと YOLOv5 および ConvLSTM を用いた変種を比較する。
  • 3段階の訓練パイプラインを採用:静的画像(HGP)での事前学習、動画フレーム(THGP)での微調整、時間的拡張を用いたエンドツーエンド訓練。

実験結果

リサーチクエスチョン

  • RQ1QRNN は、リアルタイムハンドガン検出において、動画内の空間的・時間的特徴を効果的に抽出でき、ConvLSTM を用いたモデルと同等またはそれを上回る性能を示せるか?
  • RQ2時間的データ拡張(時間的 Mosaic および Mixup)は、モデルの複雑さを増さずに、時間的オブジェクト検出器の精度をどの程度向上させるか?
  • RQ3時間的オブジェクト検出ベンチマークにおける、QRNN を用いたアーキテクチャ、ConvLSTM を用いたアーキテクチャ、および標準 YOLOv5 との間で、推論速度および mAP 50:95 の観点から性能にどのような差が生じるか?
  • RQ4RNN を用いた代替手法と比較して、QRNN は推論時間を著しく短縮しつつ、高い精度を維持できるか?
  • RQ5提案された公開データセット(HGP と THGP)は、従来の静的画像のみを対象としたハンドガン検出ベンチマークと比較して、モデルの汎化性能をどの程度向上させるか?

主な発見

  • TYolov5 に QRNN を適用した大型アーキテクチャは、mAP 50:95 が 60.2 を達成し、YOLOv5l(59.3)を上回り、最良の ConvLSTM を用いたモデル(60.0)と同等の性能を示したが、推論速度が速かった。
  • TYolov5 の小型アーキテクチャは、mAP 50:95 が 55.9、推論速度が 52.6 FPS を達成し、リアルタイム性能を維持しながら YOLOv5s(54.8 mAP 50:95)を上回った。
  • TYolov5 の中型アーキテクチャは、QRNN を用いて mAP 50:95 が 59.0、推論速度が 31.0 FPS を達成し、YOLOv5m(58.2 mAP 50:95)を上回り、ConvLSTM を用いたモデルと比較して 1.5 倍の高速化を達成した。
  • 時間的データ拡張(Mosaic および Mixup)により、モデルの精度が 2.1 mAP 50:95 ポints 向上し、空間的・時間的汎化性能の向上に有効であることが示された。
  • QRNN は、標準 RNN と比較して推論時間を最大 16 倍短縮し、精度は同等または上回り、特にフル精度浮動小数点設定下で ConvLSTM を上回った。
  • 提案されたデータセット HGP(2199枚の画像)および THGP(5960フレームの動画)は、ハンド、ガン、電話のバウンディングボックスを含む現実的で文脈豊かな訓練データを提供し、モデルの頑健性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。