[논문 리뷰] Video Anomaly Detection and Explanation via Large Language Models
이 논문은 임계값 의존성을 제거하고 탐지된 이상 현상에 대한 텍스트 설명을 제공하기 위해 영상 기반 대규모 언어 모델(VLLM)을 활용하는 비디오 이상 탐지 프레임워크인 VAD-LLaMA를 제안한다. 장기적 맥락(LTC) 모듈을 도입하여 장거리 영상 이해 능력을 향상시키고, 데이터 및 레이블링 비용을 줄이기 위한 삼단계 훈련 방법을 적용함으로써, UCF-Crime에서 88.13%, TAD에서 91.77%의 최신 기술 수준(AUC) 성능을 달성하며, 설명 가능한 이상 탐지 기능을 제공한다.
Video Anomaly Detection (VAD) aims to localize abnormal events on the timeline of long-range surveillance videos. Anomaly-scoring-based methods have been prevailing for years but suffer from the high complexity of thresholding and low explanability of detection results. In this paper, we conduct pioneer research on equipping video-based large language models (VLLMs) in the framework of VAD, making the VAD model free from thresholds and able to explain the reasons for the detected anomalies. We introduce a novel network module Long-Term Context (LTC) to mitigate the incapability of VLLMs in long-range context modeling. We design a three-phase training method to improve the efficiency of fine-tuning VLLMs by substantially minimizing the requirements for VAD data and lowering the costs of annotating instruction-tuning data. Our trained model achieves the top performance on the anomaly videos of the UCF-Crime and TAD benchmarks, with the AUC improvements of +3.86\% and +4.96\%, respectively. More impressively, our approach can provide textual explanations for detected anomalies.
연구 동기 및 목표
- 점수 기반 방법의 한계를 극복하고, 임계값이 없으며 내재적으로 설명 가능한 비디오 이상 탐지(VAD) 시스템을 개발하는 것.
- 기존 VLLM이 장시간 감시 영상에서 장거리 맥락 모델링 능력이 떨어지는 문제를 해결하는 것.
- 효율적인 삼단계 훈련 전략을 설계하여 대규모 도메인 전용 VAD 레이블링에 대한 의존도를 줄이는 것.
- 사람의 인지 방식과 일치하는 방식으로 VLLM이 이상을 탐지하고 설명할 수 있도록 하는 것. 즉, 관련 없는 물체를 이상으로 식별하는 것을 방지하는 것.
- 약한 감독 기반 표준 VAD 벤치마크에서 최신 기술 수준의 성능를 달성하면서도, 다중 대화 기반 이상 설명을 제공하는 것.
제안 방법
- 장기적 맥락(LTC) 모듈을 도입하여, 상위-K개의 가장 정상적이고 비정상적인 클립 특징을 온라인 리스트로 유지하고, 이들을 교차 어텐션 및 가중합 연산을 통해 통합함으로써 영상 표현을 향상시킨다.
- 삼단계 훈련 파이프라인을 활용한다: (1) 기준 VADor를 사전 훈련하고, (2) 자체 생성된 이상 점수를 기반으로 VADor와 LTC를 공동 훈련하며, (3) 합성 지시 템플릿을 사용하여 VLLM을 미세조정한다.
- 비디오 클립 특징을 Video-LLaMA의 비디오 인코더로부터 추출하여 VADor의 입력으로 사용함으로써, 최소한의 인간 레이블링 데이터로도 엔드 투 엔드 훈련이 가능하도록 한다.
- 기본 VADor로부터 자가학습 기반 이상 점수 생성을 활용하여 합성 지시 훈련 데이터셋을 생성함으로써, 수동 레이블링 노력 최소화.
- 실시간 추론 중에 각 신규 클립이 평가되고, 정상/비정상 특징 리스트가 동적으로 업데이트되는 동적 리스트 업데이트 메커니즘을 적용한다.
- 텍스트 템플릿을 활용하여 VLLM을 위한 지시 훈련 데이터를 생성함으로써, '이상이 있는가?' 또는 '이상의 원인은 무엇인가?'와 같은 질문에 답할 수 있도록 한다.
![Figure 1 : Prediction scores from a baseline VAD model, and clip descriptions by using VLLMs, for a car accident video (as shown in the middle of the figure). On the score curve, the red dashed lines denote anomaly thresholds. The bottom shows the answers from Video-LLaMA [ 24 ] by feeding it with t](https://ar5iv.labs.arxiv.org/html/2401.05702/assets/figure/shortcomings_v6.png)
실험 결과
연구 질문
- RQ1VLLM을 VAD에 효과적으로 통합하여 임계값이 없고 설명 가능한 이상 탐지 기능을 구현할 수 있는가?
- RQ2일반적으로 짧은 영상에서 사전 훈련된 VLLM이 장시간 영상 맥락에 적응할 수 있도록 어떻게 조정할 수 있는가?
- RQ3삼단계 훈련 전략이 고비용 VAD 레이블링이 필요한 양을 크게 줄일 수 있는가?
- RQ4장기적 정상 및 비정상 맥락을 통합함으로써 이상 탐지의 강건성과 설명 가능성은 향상되는가?
- RQ5모델이 인간의 인지와 일치하는 설명을 생성하여, '자동차 사고'와 같이 진짜 이상 원인을 정확히 식별하고 관련 없는 물체에 대해 잘못된 경고를 내보내지 않는가?
주요 결과
- 제안된 VAD-LLaMA는 UCF-Crime 벤치마크에서 최신 기술 수준의 AUC 88.13%를 달성하였으며, 이는 TAD에서 +2.26% 향상되고 UCF-Crime에서 +0.85% 향상된 성능이다.
- 기본 모델 대비 UCF-Crime에서 +3.86%, TAD에서 +4.96% 향상되어, LTC와 훈련 전략의 효과를 입증한다.
- 제거 분석 결과, LTC 모듈에서 정상 및 비정상 맥락 리스트를 모두 사용할 경우 성능이 가장 높으며, K=4일 때 최적의 리스트 길이로 확인되었다.
- 클래스별 분석 결과, 장거리 이상 클래스인 '불태우기' 및 '도둑질'에 대해 기준 모델 대비 뚜렷한 성능 향상을 보였으며, 이는 맥락 추론이 필요한 경우에 유의미하다.
- 다중 대화 기반 상호작용에서 정확하고 인간의 인지와 일치하는 설명을 생성하여, '자동차 사고'와 같은 이상 원인을 정확히 식별하고 관련 없는 물체에 대한 오진 경고를 방지한다.
- 삼단계 훈련 방법은 지시 훈련 데이터의 수동 레이블링 필요성을 줄여주며, 제한된 VAD 데이터셋에서 VLLM의 효율적 미세조정을 가능하게 한다.
![Figure 2 : The network architecture of the proposed VAD-LLaMA. It consists of a Video Anomaly Detector (VADor) with the Long-Term Context (LTC) module and a simple Anomaly Predictor (AP), a projection layer (called Adaptor), and the pre-trained Video-LLaMA [ 24 ] (composed by a Video Encoder (VE) an](https://ar5iv.labs.arxiv.org/html/2401.05702/assets/figure/pipeline_v15.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.