Skip to main content
QUICK REVIEW

[논문 리뷰] YouTube-GDD: A challenging gun detection dataset with rich contextual information

Yongxiang Gu, Xingbin Liao|arXiv (Cornell University)|2022. 03. 08.
Rabies epidemiology and control인용 수 9
한 줄 요약

이 논문은 343개의 HD 유튜브 영상에서 촬영한 5,000장의 이미지를 포함한 고성능 동적 총 탐지 데이터셋인 YouTube-GDD를 소개한다. 이 데이터셋에는 총 16,064개의 총 인스턴스와 9,046명의 사람 인스턴스가 주석 처리되어 있으며, 이는 YOLOv5s의 AP를 AP50 기준 2.3점, AP 기준 0.1점 향상시키는 데 기여한다. 특히 전이 학습과 함께 사용할 경우 성능 향상이 뚜렷하다.

ABSTRACT

An automatic gun detection system can detect potential gun-related violence at an early stage that is of paramount importance for citizens security. In the whole system, object detection algorithm is the key to perceive the environment so that the system can detect dangerous objects such as pistols and rifles. However, mainstream deep learning-based object detection algorithms depend heavily on large-scale high-quality annotated samples, and the existing gun datasets are characterized by low resolution, little contextual information and little data volume. To promote the development of security, this work presents a new challenging dataset called YouTube Gun Detection Dataset (YouTube-GDD). Our dataset is collected from 343 high-definition YouTube videos and contains 5000 well-chosen images, in which 16064 instances of gun and 9046 instances of person are annotated. Compared to other datasets, YouTube-GDD is "dynamic", containing rich contextual information and recording shape changes of the gun during shooting. To build a baseline for gun detection, we evaluate YOLOv5 on YouTube-GDD and analyze the influence of additional related annotated information on gun detection. YouTube-GDD and subsequent updates will be released at https://github.com/UCAS-GYX/YouTube-GDD.

연구 동기 및 목표

  • 실세계 감시 응용 분야에 적합한 풍부한 맥락 정보를 갖춘 고품질, 대규모 총 탐지 데이터셋의 부족 문제를 해결하기 위해.
  • 기존 데이터셋이 저해상도, 제한된 맥락 데이터, 실제 감시 영상과의 분포 불일치 등의 문제를 겪고 있는 점을 극복하기 위해.
  • 보조 감독으로서 사람 주석을 통합하여 모델의 일반화 능력과 성능 향상을 도모함으로써 총 탐지의 강건성을 향상시키기 위해.
  • YouTube-GDD를 공개하고 YOLOv5s를 강력한 기준 모델로 평가함으로써 총 탐지에 대한 벤치마크를 수립하기 위해.

제안 방법

  • 343개의 HD 유튜브 영상에서 5,000장의 고해상도 이미지를 촬영하여 다양한 실세계 환경에서의 동적 총 모습을 반영한 다양하고 현실적인 데이터셋을 구성하였다.
  • 총 16,064개의 총 인스턴스와 9,046명의 사람 인스턴스를 주석 처리하여 탐지 성능 향상을 위한 풍부한 맥락적 및 공간적 관계를 제공하였다.
  • 자기상호정보량(Jensen-Shannon divergence)을 사용하여 데이터셋을 10개의 폴드로 분할하였으며, 스케일 분포가 균형 잡히도록 하였고, 폴드 6(검증), 폴드 7(테스트)를 평가용으로 지정하였다.
  • COCO 사전학습 가중치에서 전이 학습을 수행한 YOLOv5s를 훈련하고, COCO 스타일 메트릭(AP 및 AP50)을 사용하여 성능을 평가하였다.
  • 사람 주석의 영향을 평가하기 위해 사람 탐지 헤드가 포함된 모델과 포함되지 않은 모델을 각각 훈련시고 성능 향상을 비교하였다.
  • 표준 훈련 프로토콜을 사용: 입력 크기 640×640, SGD 옵티마이저, 300 에포크, 웜업, NMS 후처리

실험 결과

연구 질문

  • RQ1다양한 총의 동적 모습과 맥락 정보를 갖춘 대규모 고품질 데이터셋이 총 탐지 성능 향상에 기여할 수 있는가?
  • RQ2복잡한 실세계 환경에서 총 탐지 모델의 성능에 사람 주석이 미치는 영향은 어떠한가?
  • RQ3COCO 사전학습에서의 전이 학습이 YouTube-GDD 데이터셋에서 탐지 정확도 향상에 어느 정도 기여하는가?
  • RQ4다양한 총의 크기, 자세, 사격 중 동적 변화를 포함한 데이터셋에서 최신 기술인 YOLOv5s의 성능은 얼마나 강건한가?
  • RQ5사람 주석 추가로 얻는 AP 및 AP50 성능 향상은 얼마나 되며, 이는 최소한의 계산 부담에도 불구하고 유의미한가?

주요 결과

  • 전이 학습과 함께 사람 주석을 YOLOv5s 모델에 추가한 결과, AP50는 2.3점, AP는 0.1점 향상되어 맥락적 감독의 가치를 입증하였다.
  • 사람 주석을 포함한 채로 초기 훈련을 수행한 결과, AP50는 0.2점, AP는 0.3점 향상되어 일관된 성능 향상이 확인되었다.
  • 전이 학습과 사람 주석을 모두 적용한 모델은 총 탐지에 대해 77.3%의 AP50와 52.1%의 AP를 기록했으며, 사람 탐지에 대해서는 92.4%의 AP50와 81.2%의 AP를 기록하였다.
  • 촬영 중 형태 변화를 반영한 데이터셋의 동적 특성은 기존 탐지기법에 큰 도전 과제를 제기하며, 강건하고 맥락 인식 능력이 뛰어난 모델의 필요성을 강조한다.
  • 사람 주석 추가로 인한 계산 부담은 극히 미미하였으며, GFLOPs와 파라미터 수는 거의 동일하게 유지되었다(15.81 GFLOPs, 7.02M parameters).
  • YouTube-GDD는 정적이고 저품질인 데이터셋보다 실제 영상 분포를 더 잘 반영하므로 일반화 및 강건성 평가에 적합한 데이터셋이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.