[논문 리뷰] TAD: A Large-Scale Benchmark for Traffic Accidents Detection from Video Surveillance
이 논문은 실제 감시 카메라에서 수집한 실차량 사고 영상에 기반한 대규모 공개 기준 데이터셋인 TAD를 소개한다. 특히 고속도로 환경을 대상으로 하며, 영상 기반 사고 탐지에 대한 종합적인 평가를 가능하게 하여, 이미지 분류, 객체 검출, 영상 분류 작업을 수행한다. 결과적으로 영상 수준의 모델이 시간적 특성 모델링 능력 덕분에 이미지 수준의 방법보다 우수한 성능을 보이며, SlowFast-ResNet50 모델이 영상 수준 분류에서 F1 점수 0.680을 기록하였다.
Automatic traffic accidents detection has appealed to the machine vision community due to its implications on the development of autonomous intelligent transportation systems (ITS) and importance to traffic safety. Most previous studies on efficient analysis and prediction of traffic accidents, however, have used small-scale datasets with limited coverage, which limits their effect and applicability. Existing datasets in traffic accidents are either small-scale, not from surveillance cameras, not open-sourced, or not built for freeway scenes. Since accidents happened in freeways tend to cause serious damage and are too fast to catch the spot. An open-sourced datasets targeting on freeway traffic accidents collected from surveillance cameras is in great need and of practical importance. In order to help the vision community address these shortcomings, we endeavor to collect video data of real traffic accidents that covered abundant scenes. After integration and annotation by various dimensions, a large-scale traffic accidents dataset named TAD is proposed in this work. Various experiments on image classification, object detection, and video classification tasks, using public mainstream vision algorithms or frameworks are conducted in this work to demonstrate performance of different methods. The proposed dataset together with the experimental results are presented as a new benchmark to improve computer vision research, especially in ITS.
연구 동기 및 목표
- 고속도로 사고에 집중된 대규모 공개 기반 감시 영상 데이터셋의 부족을 보완하기 위해.
- 다양한 비전 작업을 통해 사고 탐지 알고리즘을 평가할 수 있는 종합적 기준을 제공하기 위해.
- 다양한 사고 유형, 환경, 기상 조건을 포함시켜 모델의 일반화 능력을 향상시키기 위해.
- 강건하고 실생활 적용이 가능한 지능형 교통 시스템(ITS)의 개발을 지원하기 위해.
- 순차적 영상 데이터를 활용해 사고 탐지에서 시간적 모델링 연구를 가능하게 하기 위해.
제안 방법
- 다양한 고속도로 환경에서 실차량 사고 영상을 CCTV 감시 시스템을 통해 수집하였다.
- 사고 유형, 관여 객체, 공간-시간 경계 등 다중 레이블을 포함한 영상 주석 처리를 수행하였다.
- 12개의 다른 사고 유형(충돌, 전복, 보행자 및 자전거 기여 사고 포함)을 포함한 1,000개 이상의 영상으로 구성된 대규모 데이터셋을 구축하였다.
- 이미지 분류, 객체 검출, 영상 분류 작업을 위해 주류 딥러닝 모델인 ResNet50, YOLOv5m, SlowFast-ResNet50를 적용하였다.
- 이미지 수준 및 영상 수준 작업에서 표준 평가 지표인 재현율, 정밀도, F1 점수를 사용해 모델 성능을 평가하였다.
- 프레임 수준 예측의 시간적 집계를 통해 운동 및 순서 동적 특성을 모델링함으로써 사고 탐지 성능을 향상시켰다.
실험 결과
연구 질문
- RQ1실제 감시 영상에서 유도된 대규모 공개 기반 데이터셋이 사고 탐지 모델의 일반화 능력과 강건성 향상에 기여할 수 있는가?
- RQ2영상 수준 분류에서의 시간적 모델링이 이미지 수준 분류에 비해 사고 탐지에서 왜 우수한 성능을 내는가?
- RQ3이미지 분류, 객체 검출, 영상 분류 모델 간의 사고 탐지 작업에서 성능 차이는 어떠한가?
- RQ4왜 일부 사고 유형, 예를 들어 '충돌'과 '피해자' 유형은 탐지 모델에서 높은 임의 경고율을 유발하는가?
- RQ5순차적 영상 정보를 통합할 경우 사고 인식의 정확도와 안정성은 어느 정도 향상되는가?
주요 결과
- SlowFast-ResNet50를 활용한 영상 수준 분류에서 F1 점수 0.680을 기록하였으며, 시간적 동적 특성을 더 잘 활용함으로써 이미지 수준 분류(F1 점수: 0.454)보다 뛰어난 성능을 보였다.
- YOLOv5m를 활용한 객체 검출에서 재현율은 0.997에 도달했지만 정밀도는 0.487로 낮아, 프레임 단위 탐지에서의 불안정성과 높은 참성분 오류율을 나타냈다.
- 이미지 수준 탐지 모델은 분류 모델 대비 상당히 낮은 재현율(0.261)을 보이며, 영상 프레임 간 사고 지역을 정확히 국소화하는 데 어려움을 겪고 있음을 보여주었다.
- 여러 영상 프레임의 예측 결과를 통합할 경우 사고 탐지 성능이 크게 향상되며, 일관된 시간적 패턴은 실제 사고를 더 신뢰할 수 있는 지표임을 확인하였다.
- '충돌'과 '피해자' 유형이 낮은 전체 정확도의 주요 원인로 작용하였으며, 이는 미세하거나 복잡한 사고 시나리오를 구분하는 데 어려움이 있음을 시사한다.
- TAD는 다중 차량 충돌, 보행자 충격, 전복 등 다양한 사고 유형을 포함하여 기존 데이터셋보다 richer한 시각적 및 맥락적 특징을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.