Skip to main content
QUICK REVIEW

[논문 리뷰] TYolov5: A Temporal Yolov5 Detector Based on Quasi-Recurrent Neural Networks for Real-Time Handgun Detection in Video

Mario Alberto Duran-Vega, Miguel González-Mendoza|arXiv (Cornell University)|2021. 11. 16.
Anomaly Detection Techniques and Applications인용 수 5
한 줄 요약

이 논문은 비디오의 시공간적 특징을 활용하기 위해 Quasi-Recurrent Neural Networks (QRNNs)를 YOLOv5에 통합한 실시간 시간적 권총 탐지 시스템인 TYolov5를 제안한다. 다중 척도 특징 맵에 QRNN을 통합하고 시간적 데이터 증강(Mosaic 및 Mixup)을 적용함으로써, YOLOv5 및 ConvLSTM 기반 모델보다 더 빠른 추론 속도와 향상된 mAP 50:95(최대 60.2)를 달성하면서도 소형, 중형, 대형 아키텍처 전반에서 실시간 성능 유지를 유지한다.

ABSTRACT

Timely handgun detection is a crucial problem to improve public safety; nevertheless, the effectiveness of many surveillance systems still depends of finite human attention. Much of the previous research on handgun detection is based on static image detectors, leaving aside valuable temporal information that could be used to improve object detection in videos. To improve the performance of surveillance systems, a real-time temporal handgun detection system should be built. Using Temporal Yolov5, an architecture based on Quasi-Recurrent Neural Networks, temporal information is extracted from video to improve the results of handgun detection. Moreover, two publicly available datasets are proposed, labeled with hands, guns, and phones. One containing 2199 static images to train static detectors, and another with 5960 frames of videos to train temporal modules. Additionally, we explore two temporal data augmentation techniques based on Mosaic and Mixup. The resulting systems are three temporal architectures: one focused in reducing inference with a mAP$_{50:95}$ of 55.9, another in having a good balance between inference and accuracy with a mAP$_{50:95}$ of 59, and a last one specialized in accuracy with a mAP$_{50:95}$ of 60.2. Temporal Yolov5 achieves real-time detection in the small and medium architectures. Moreover, it takes advantage of temporal features contained in videos to perform better than Yolov5 in our temporal dataset, making TYolov5 suitable for real-world applications. The source code is publicly available at https://github.com/MarioDuran/TYolov5.

연구 동기 및 목표

  • 비디오 감시에서 시간적 맥락을 忽시하는 정적 이미지 기반 권총 탐지기의 한계를 해결하기 위해.
  • 순차적 비디오 정보를 활용해 정확도를 향상시키는 실시간 시간적 객체 탐지 시스템을 개발하기 위해.
  • ConvLSTM과 비교해 Quasi-Recurrent Neural Networks (QRNNs)가 시간적 객체 탐지에서 얼마나 효과적인지 평가하기 위해.
  • 손, 권총, 핸드폰을 레이블링한 두 개의 공개 데이터셋—HGP(2199장의 정적 이미지)와 THGP(5960개의 비디오 프레임)—을 소개하기 위해.
  • 시공간 모델 성능 향상을 위한 시간적 데이터 증강 기법(시간적 Mosaic 및 Mixup)을 탐색하고 검증하기 위해.

제안 방법

  • 다중 척도 특징 맵에 QRNN 모듈을 통합해 프레임 간 시공간적 특징을 추출하고 전파하기 위해.
  • 컨볼루션 레이어를 활용한 준순환 풀링 메커니즘을 사용해 표준 RNN과 비교해 병렬 처리가 가능하고 더 빠른 훈련/추론을 가능하게 하기 위해.
  • Mosaic 및 Mixup 기법을 비디오 시퀀스로 확장해 시간적 데이터 증강을 적용함으로써 모델 복잡도를 증가시키지 않고도 일반화 성능을 향상시키기 위해.
  • 혼합 정밀도 및 전체 정밀도 추론을 사용해 200 에포크 동안 혼합 데이터셋 HGP와 THGP를 사용해 세 가지 아키텍처(소형, 중형, 대형)를 훈련 및 평가하기 위해.
  • mAP 50:95, 추론 속도(FPS), 파라미터 효율성 측면에서 QRNN 기반 모델을 YOLOv5 및 ConvLSTM 기반 변종과 비교하기 위해.
  • 세 단계 훈련 파이프라인을 적용: 정적 이미지(HGP)에서의 사전 훈련, 비디오 프레임(THGP)에서의 미세조정, 시간적 증강을 통한 엔드 투 엔드 훈련.

실험 결과

연구 질문

  • RQ1QRNNs는 실시간 권총 탐지에서 비디오의 시공간적 특징을 효과적으로 추출할 수 있는가? 이는 ConvLSTM 기반 모델보다 우월하거나 동등한 성능을 내는가?
  • RQ2시간적 데이터 증강(시간적 Mosaic 및 Mixup)은 모델 복잡도를 증가시키지 않으면서도 시간적 객체 탐지기의 정확도를 어느 정도 향상시키는가?
  • RQ3비디오 기반 권총 탐지 벤치마크에서 QRNN 기반 아키텍처는 ConvLSTM 기반 및 표준 YOLOv5와 비교해 추론 속도와 mAP 50:95 측면에서 어떻게 비교되는가?
  • RQ4RNN 기반 대안과 비교해 QRNNs는 실시간 비디오 탐지에서 유의미하게 감소된 추론 시간을 유지하면서도 높은 정확도를 유지할 수 있는가?
  • RQ5제안된 공개 데이터셋(HGP 및 THGP)은 존재하는 정적 이미지 전용 권총 탐지 기준과 비교해 모델 일반화 능력을 어느 정도 향상시키는가?

주요 결과

  • TYolov5에 QRNN을 적용한 결과, 대형 아키텍처에서 mAP 50:95가 60.2를 기록해 YOLOv5l(59.3)을 초월하고 최고의 ConvLSTM 기반 모델(60.0)과 동등한 성능을 내며 더 빠른 추론 속도를 확보했다.
  • TYolov5의 소형 아키텍처는 55.9 mAP 50:95와 52.6 FPS를 기록해 실시간 성능을 유지하면서 YOLOv5s(54.8 mAP 50:95)를 뛰어넘었다.
  • TYolov5의 중형 아키텍처는 QRNN을 사용해 59.0 mAP 50:95와 31.0 FPS를 기록했으며, YOLOv5m(58.2 mAP 50:95)를 초월했고, ConvLSTM 기반 대안 대비 1.5배 빠른 속도를 기록했다.
  • 시간적 데이터 증강(Mosaic 및 Mixup)은 모델 정확도를 2.1 mAP 50:95 포인트 향상시켜 시공간 일반화 능력 향상의 효과를 입증했다.
  • QRNNs는 표준 RNN 대비 추론 시간을 최대 16배 감소시켰고, 정확도는 동등하거나 뛰어난 성능를 기록했으며, 특히 전체 정밀도 부동소수점 설정에서 ConvLSTM을 능가했다.
  • 제안된 데이터셋 HGP(2199장의 이미지)와 THGP(5960개의 비디오 프레임)는 손, 권총, 핸드폰에 대한 바운딩 박스를 포함한 현실적이고 맥락이 풍부한 훈련 데이터를 제공해 모델의 강건성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.