[논문 리뷰] Audio-visual Representation Learning for Anomaly Events Detection in Crowds
이 논문은 3D CNN 기반의 비디오 특징과 로그 멜 스펙트로그램에서 추출한 VGGish로 인코딩된 음성 특징을 융합하여 군중 상황에서의 이상 탐지 성능을 향상시키는 다중 모odal 프레임워크인 오디오-비주얼 표현 학습(AVRL)을 제안한다. 이 방법은 SHADE 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 특히 시야가 떨어지는 조건에서 뚜렷한 정확도 향상을 보이며, 총격이나 주저하는 행동과 같은 사건 탐지에서 음성의 보완적 역할을 입증한다.
In recent years, anomaly events detection in crowd scenes attracts many researchers' attention, because of its importance to public safety. Existing methods usually exploit visual information to analyze whether any abnormal events have occurred due to only visual sensors are generally equipped in public places. However, when an abnormal event in crowds occurs, sound information may be discriminative to assist the crowd analysis system to determine whether there is an abnormality. Compare with vision information that is easily occluded, audio signals have a certain degree of penetration. Thus, this paper attempt to exploit multi-modal learning for modeling the audio and visual signals simultaneously. To be specific, we design a two-branch network to model different types of information. The first is a typical 3D CNN model to extract temporal appearance features from video clips. The second is an audio CNN for encoding Log Mel-Spectrogram of audio signals. Finally, by fusing the above features, a more accurate prediction will be produced. We conduct the experiments on SHADE dataset, a synthetic audio-visual dataset in surveillance scenes, and find introducing audio signals effectively improves the performance of anomaly events detection and outperforms other state-of-the-art methods. Furthermore, we will release the code and the pre-trained models as soon as possible.
연구 동기 및 목표
- 장애물에 의한 가림이나 낮은 시야로 인해 시각적 탐지가 어려운 군중 상황에서의 시각적 탐지 한계를 해결한다.
- 이상 사건 탐지에 있어 시각 데이터에 대한 보완적인 모odal로 음성 신호의 잠재력을 탐구한다.
- 시각적 및 음성 표현을 효과적으로 융합하여 탐지 정확도를 향상시키는 다중 모달 학습 프레임워크를 개발한다.
- 시각적 단서가 떨어지는 상황에서 음성 특징의 효과성을 입증한다.
- 동기화된 오디오와 비디오를 갖춘 합성 데이터셋을 사용하여 감시 응용 분야에서의 오디오-비주얼 표현 학습에 대한 기초를 마련한다.
제안 방법
- 비디오 클립에서 운동 및 외관 역동성을 캡처하기 위해 스파atiotemporal 특징을 추출하기 위해 3D ResNet 기반을 사용한다.
- 원시 음성 신호를 로그 멜 스펙트로그램으로 변환하고, VGGish 모델을 사용하여 분류 가능한 음성 표현 학습을 수행한다.
- 특징 수준에서 연결을 통해 시각적 및 음성 특징을 융합하여 다중 모달 신호의 공동 모델링을 가능하게 한다.
- 다중 클래스 이상 사건 분류를 위해 교차 엔트로피 손실을 사용하여 엔드 투 엔드 AVRL 프레임워크를 훈련시킨다.
- 무작위 시간적 및 공간적 패치를 통한 데이터 증강을 적용하여 정확도 및 모달 기여도를 평가한다.
- 시각적 전용(3D ResNet), 음성 전용(VGGish), 오디오-시각 융합(AVRL) 구성 간 성능 비교를 위한 분석 연구를 수행한다.

실험 결과
연구 질문
- RQ1시각 데이터가 가림되거나 열악한 조건에서 음성 신호가 이상 탐지 성능을 향상시킬 수 있는가?
- RQ2총격이나 폭력 사건과 같은 특정 이상 사건 탐지에서 시각적 및 음성 표현이 어떻게 다르게 기여하는가?
- RQ33D-CNN와 음성 CNN 특징을 융합할 때 최적의 융합 전략은 무엇인가?
- RQ4어두운 환경에서 시각 품질이 열 劣한 상황에서 AVRL의 성능은 어떻게 변하는가?
- RQ5공간적 또는 시간적 왜곡이 모델의 정확도에 미치는 영향은 각각 어떠한가?
주요 결과
- AVRL 프레임워크는 '총격' 이벤트에서 상위-1 정확도 95.9%를 기록하며, 시각 전용 3D ResNet(89.8%) 및 음성 전용 VGGish(91.8%)보다 뚜렷한 성능 향상을 보였다.
- 어두운 서브셋에서 시각 품질이 열 劣한 상황에서, AVRL은 '폭력', '달리기', '추격전' 이벤트의 탐지 정확도를 시각 전용 방법보다 향상시켰다.
- 음성 전용 VGGish는 '총격' 이벤트에서 높은 정확도(91.8%)를 달성하여 특정 이상 사건에 대해 고유한 음성 패tern이 매우 분류 가능하다는 것을 시사한다.
- 분석 연구 결과, 평균적으로 시각적 특징이 음성 특징보다 더 큰 기여를 하지만, 음성 특징은 모든 카테고리에서 성능 향상을 이끌어냈다.
- 공간적 패치가 시간적 패치보다 정확도에 더 큰 부정적 영향을 미치며, 이는 이벤트 인식에 있어 공간적 맥락이 시간적 연속성보다 더 중요하다는 것을 시사한다.
- 80%의 공간적 패치 비율에서, 일부 클래스에서 시각 전용 성능이 음성 전용 성능 이하로 떨어지며, 이는 과도한 시각적 손상이 모델을 오도할 수 있음을 시사한다.
![Figure 2: AVRL for abnormal events detection in crowd scenes. The details of 3D ResNet and VGGish is the same as [ 28 ] and [ 29 ] respectively.](https://ar5iv.labs.arxiv.org/html/2110.14862/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.