Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Regularity in Skeleton Trajectories for Anomaly Detection in Videos

Romero Morais, Vuong Le|arXiv (Cornell University)|2019. 03. 08.
Anomaly Detection Techniques and Applications참고 문헌 29인용 수 11
한 줄 요약

이 논문은 감시 영상에서 이상 행위를 탐지하기 위해 인간의 뼈대 궤적을 전역적 신체 운동과 국소적 자세 구성요소로 분해하는 새로운 메시지 전달 인코더-디코더 순환 신경망(MPED-RNN)을 제안한다. 이 방법은 각 시간 단계에서 교차 브랜치 메시지 전달을 통해 분리된 운동 동역학을 모델링함으로써 상태의 최선(SOTA) 성능를 달성하면서도 의미적으로 유의미한 특징 시각화와 의사결정 설명을 통해 해석 가능성의 향상을 이룬다.

ABSTRACT

Appearance features have been widely used in video anomaly detection even though they contain complex entangled factors. We propose a new method to model the normal patterns of human movements in surveillance video for anomaly detection using dynamic skeleton features. We decompose the skeletal movements into two sub-components: global body movement and local body posture. We model the dynamics and interaction of the coupled features in our novel Message-Passing Encoder-Decoder Recurrent Network. We observed that the decoupled features collaboratively interact in our spatio-temporal model to accurately identify human-related irregular events from surveillance video sequences. Compared to traditional appearance-based models, our method achieves superior outlier detection performance. Our model also offers "open-box" examination and decision explanation made possible by the semantically understandable features and a network architecture supporting interpretability.

연구 동기 및 목표

  • 고차원적이고 노이즈가 많고 구조가 없는 특징으로 인해 의미가 흐려지는 외관 기반 영상 이상 탐지의 한계를 해결한다.
  • 구조적이고 의미적으로 풍부한 뼈대 특징을 활용하여 딥 러닝 모델의 해석 가능성 부족 문제를 해결하고 개방형 분석을 지원한다.
  • 전역 운동과 국소 자세 동역학으로 분해하여 인간 운동의 규칙성을 명시적으로 모델링함으로써 이상 탐지 성능을 향상시킨다.
  • 각 특징 구성요소가 최종 이상 점수에 기여하는 방식을 시각화하고 의사결정 가중치를 노출함으로써 모델의 해석 가능성을 지원한다.

제안 방법

  • 2D 뼈대 궤적을 전역적 신체 운동(장면 내 전체 신체 운동 동역학)과 국소적 신체 자세(신체 기준 좌표계 내 뼈대 구조)로 두 개의 하위 구성요소로 분해한다.
  • 각 시간 단계에서 교차 브랜치 메시지 전달을 통해 상호작용하는 전역 및 국소 특징을 위한 별도의 RNN 브랜치를 갖춘 메시지 전달 인코더-디코더 순환 신경망(MPED-RNN)을 설계한다.
  • 학습 시퀀스에서 정규화를 적용하여 정상 행동의 압축된 대표 프로파일을 추출하는 종단간(end-to-end) 모델을 훈련한다.
  • 각 특징 구성요소가 최종 이상 점수에 기여하는 정도를 시각화하고 학습된 가중치를 노출함으로써 해석 가능성을 지원한다.
  • 공간-시간 모델링을 통해 장거리 의존성과 전역 및 국소 운동 패tern 간의 동적 상호작용을 포착한다.
  • 메시지 전달 프레임워크를 확장하여 비-뼈대 특징 통합과 다중 인물 및 물체 수준 이상 탐지로의 향후 확장 가능성을 지원한다.

실험 결과

연구 질문

  • RQ1전체 외관 기반 모델과 비교해 뼈대 궤적을 전역 운동과 국소 자세로 분해하는 것이 이상 탐지 성능 향상에 기여하는가?
  • RQ2의미적으로 유의미한 특징 표현을 통해 제안된 MPED-RNN 모델이 높은 성능를 유지하면서도 해석 가능성을 확보할 수 있는가?
  • RQ3뼈대 기반 이상 탐지의 주요 실패 유형은 무엇이며, 뼈대 검출 정확도 부족이나 운동-자세 유사성에 기인한 오류와의 관련성은 어떠한가?
  • RQ4전역 및 국소 RNN 브랜치 간 메시지 전달 메커니즘이 미세한 이상을 탐지하는 데 모델의 능력을 어떻게 향상시키는가?
  • RQ5제안된 방법은 다양한 품질과 이상 유형을 가진 감시 영상 데이터셋 간에 일반화 가능한가?

주요 결과

  • HR-Avenue 하위 집합에서 CUHK Avenue 데이터셋에 대해 MPED-RNN은 0.863의 프레임 단위 ROC AUC 성능를 기록하여 Liu et al.(0.862)와 Conv-AE(0.848)를 초월한다.
  • 上海Tech 데이터셋에서 기존의 외관 기반 모델에 비해 우수한 이상 탐지 성능를 보였으며, 2048차원 ResNet 특징 대비 약 100차원의 뼈대 특징만을 사용한 점을 감안할 때 놀라운 성능를 기록했다.
  • 주요 오류 원인은 저해상도, 그림자, 가림 등에서의 뼈대 검출 및 추적 정확도 저하로, 이는 이상 사건의 오분류를 초래한다.
  • 비정상 행동(예: 천천히 자전거 타기)이 정상 보행과 유사한 뼈대 자세와 운동 패턴을 생성할 경우, 뼈대 특징의 기하학적 성격으로 인해 거짓 음성 결과가 발생하는 심각한 실패 케이스가 발생한다.
  • 기여 요소와 의사결정 가중치를 시각화함으로써 모델의 해석 가능성은 검증되었으며, 이는 오류 분석 및 도메인 지식 통합을 위한 모델 정밀 조정을 가능하게 한다.
  • 모델 성능가 뼈대 품질에 매우 의존하는 것으로 나타나, 향후 연구에서는 손실되거나 손상된 뼈대 입력을 보완하기 위해 외관 특징 통합이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.