[논문 리뷰] Context Recovery and Knowledge Retrieval: A Novel Two-Stream Framework for Video Anomaly Detection
이 논문은 지역 운동 패턴과 학습된 정상성 지식을 모두 활용하여 비정상 탐지 성능을 향상시키기 위해 문맥 복구와 지식 검색을 융합한 새로운 이중 스트림 프레임워크를 제안한다. 이 방법은 재구성 기반 이상 탐지 점수를 산출하기 위해 최대 局소 오차를 사용하는 시공간 U-Net을 사용하고, 정상성 지식 검색을 위해 개선된 학습 가능한 국소 민감성 해싱(iL2SH)을 적용하여 상해, 애버뉴, 코리도어, 페드2 네 가지 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.
Video anomaly detection aims to find the events in a video that do not conform to the expected behavior. The prevalent methods mainly detect anomalies by snippet reconstruction or future frame prediction error. However, the error is highly dependent on the local context of the current snippet and lacks the understanding of normality. To address this issue, we propose to detect anomalous events not only by the local context, but also according to the consistency between the testing event and the knowledge about normality from the training data. Concretely, we propose a novel two-stream framework based on context recovery and knowledge retrieval, where the two streams can complement each other. For the context recovery stream, we propose a spatiotemporal U-Net which can fully utilize the motion information to predict the future frame. Furthermore, we propose a maximum local error mechanism to alleviate the problem of large recovery errors caused by complex foreground objects. For the knowledge retrieval stream, we propose an improved learnable locality-sensitive hashing, which optimizes hash functions via a Siamese network and a mutual difference loss. The knowledge about normality is encoded and stored in hash tables, and the distance between the testing event and the knowledge representation is used to reveal the probability of anomaly. Finally, we fuse the anomaly scores from the two streams to detect anomalies. Extensive experiments demonstrate the effectiveness and complementarity of the two streams, whereby the proposed two-stream framework achieves state-of-the-art performance on four datasets.
연구 동기 및 목표
- 기존 영상 이상 탐지 방법들이 전적으로 국소 재구성 또는 예측 오차에 의존하면서 전반적인 정상성 모델링이 부족한 점을 해결한다.
- 표준 문맥 복구 모델이 인식하지 못하는 장면 기반 이상(예: 도로에서 축구를 하는 것)을 탐지하는 데 도전한다.
- 데이터 불균형으로 인해 흔하지 않은 정상 이벤트가 종종 이상으로 잘못 분류되는 문제를 개선한다.
- 단기 운동 일관성과 장기 정상 행동 지식을 통합함으로써 모델의 강건성을 향상시킨다.
- 객체 검출 또는 외부 데이터셋에 의존하지 않고도 최신 기술 수준의 성능을 달성하여 다양한 시나리오에 일반화 가능하도록 한다.
제안 방법
- 입력 스니펫의 운동 정보를 사용하여 향후 프레임을 예측하기 위해 시공간 U-Net(STU-Net)을 문맥 복구 스트림에 도입한다.
- 이상 영역의 복구 오차를 고립하고 강조함으로써 이상 탐지 점수 정밀도를 향상시키기 위해 최대 局소 오차(MLE) 메커니즘을 도입한다.
- 시ames 네트워크와 상호 차이 손실을 사용하여 정상 이벤트 표현을 위한 해시 함수를 최적화하는 개선된 학습 가능한 국소 민감성 해싱(iL2SH)을 개발한다.
- iL2SH를 사용하여 정상 이벤트를 지식 기반에 인코딩하며, 정상성 지식은 압축된 해시 코드로 저장된다.
- 테스트 스니펫의 표현과 지식 기반의 가장 가까운 항목 간의 거리를 기반으로 이상 점수를 계산하여 정상 행동과의 일관성을 반영한다.
- 두 스트림의 이상 점수를 학습된 또는 가중치 기반 조합을 통해 융합하여 최종 탐지 점수를 산출한다.
실험 결과
연구 질문
- RQ1문맥 복구와 지식 검색을 융합한 이중 스트림 프레임워크가 장면 기반 이상을 탐지하는 데 단일 스트림 방법보다 뛰어난 성능을 보일 수 있는가?
- RQ2학습 가능한 국소 민감성 해싱 메커니즘이 정상 영상 행동에 대한 지식를 효과적으로 인코딩하고 검색할 수 있는가?
- RQ3최대 局소 오차 메커니즘을 통합함으로써 재구성 기반 이상 탐지의 局소 이상에 대한 민감도가 향상되는가?
- RQ4제안된 프레임워크가 객체 검출 또는 외부 데이터셋에 의존하지 않고도 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ5두 스트림이 단기 운동 이상과 희귀하거나 맥락 기반 이상 이벤트를 탐지하는 데 어떻게 상호 보완적인가?
주요 결과
- 제안된 이중 스트림 프레임워크는 상해, 애버뉴, 코리도어, 페드2 네 가지 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.
- 상해 데이터셋에서 이 방법은 객체 검출을 사용하지 않고도 마이크로-AUC 83.7%를 기록하여 이어지는 최고 성능 방법(CAC)보다 4.4% 높고, VADB보다 5.5% 높다.
- 수동적인 영역 자르기 없이 공정한 설정에서 코리도어 데이터셋을 평가한 결과, 마이크로-AUC 73.1%를 기록하여 비교된 모든 방법 중 최고 성능이다.
- 애버뉴 데이터셋에서 프레임워크는 매크로-AUC 99.3%를 기록하여 평가된 모든 방법 중 최고 성능이다.
- 제거 분석 결과 양 스트림이 상호 보완적임을 확인: 문맥 복구 스트림은 운동 이상 탐지에 뛰어나며, 지식 검색 스트림은 맥락 기반 이상 이벤트 탐지에 기여한다.
- 이상이 객체 기반인 페드2 데이터셋에서도 이 방법은 경쟁력 있는 성능을 유지하며, 객체 검출 및 옵티컬 플로우 통합을 통해 추가로 향상시킬 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.