Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Video Violence Recognition with Human Interaction Learning on 3D Skeleton Point Clouds

Yukun Su, Guosheng Lin|arXiv (Cornell University)|2023. 08. 26.
Human Pose and Action RecognitionComputer Science인용 수 3
한 줄 요약

이 논문은 3D 스켈레톤 포인트 클라우드와 이중 브랜치 스켈레톤 포인트 상호작용 학습(Skeleton Points Interaction Learning, SPIL) 프레임워크를 사용한 새로운 비디오 폭력 인식 방법을 제안한다. 다중 헤드 국소 주의 메커니즘과 순열 불변 자기주의 메커니즘을 통해 스켈레톤 포인트 간의 국소 및 전반적 상호작용을 모델링함으로써, 다양한 폭력 인식 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 복잡한 다인승 상황에서 뛰어난 특징 학습 능력과 강건성을 입증한다.

ABSTRACT

Deep learning has proved to be very effective in video action recognition. Video violence recognition attempts to learn the human multi-dynamic behaviours in more complex scenarios. In this work, we develop a method for video violence recognition from a new perspective of skeleton points. Unlike the previous works, we first formulate 3D skeleton point clouds from human skeleton sequences extracted from videos and then perform interaction learning on these 3D skeleton point clouds. Specifically, we propose two types of Skeleton Points Interaction Learning (SPIL) strategies: (i) Local-SPIL: by constructing a specific weight distribution strategy between local regional points, Local-SPIL aims to selectively focus on the most relevant parts of them based on their features and spatial-temporal position information. In order to capture diverse types of relation information, a multi-head mechanism is designed to aggregate different features from independent heads to jointly handle different types of relationships between points. (ii) Global-SPIL: to better learn and refine the features of the unordered and unstructured skeleton points, Global-SPIL employs the self-attention layer that operates directly on the sampled points, which can help to make the output more permutation-invariant and well-suited for our task. Extensive experimental results validate the effectiveness of our approach and show that our model outperforms the existing networks and achieves new state-of-the-art performance on video violence datasets.

연구 동기 및 목표

  • 기존 방법이 가림 및 불필요한 배경 노이즈로 인해 실패하는 다인승 복잡한 비디오 장면에서 폭력 행동을 인식하는 데 도전하는 것.
  • RGB 또는 옵티컬 플로우 특징에 의존하는 대신, 3D 스켈레톤 시퀀스에서 직접 동적 인간 상호작용을 모델링하여 특징 표현을 향상시키는 것.
  • 국소 운동 역학과 스켈레톤 포인트 간의 전반적 구조적 관계를 모두 포착하는 강건하고 순열 불변의 방법을 개발하는 것.
  • 혼잡하거나 동적인 환경에서 폭력 행동 탐지에 최적화되어 있지 않은 기존 행동 인식 모델의 한계를 극복하는 것.
  • 비폭력적 신체 상호작용과 실제 폭력 행위를 구분할 수 있도록 스켈레톤 특징 학습을 향상시켜 정확한 분류를 가능하게 하는 것.

제안 방법

  • 모든 비디오 프레임에 대해 2D 인간 자세 시퀀스를 3D 스켈레톤 포인트 클라우드로 변환하여 공간-시간적 구조를 유지한다.
  • 국소적 영역의 스켈레톤 포인트 간 가중 관계를 특징과 공간-시간적 근접성 기반으로 학습하는 다중 헤드 주의 메커니즘인 Local-SPIL을 도입한다.
  • 무작위 순서의 3D 포인트 클라우드에 직접 작용하는 자기주의 레이어를 사용하여 장거리 종속성과 순열 불변성을 확보하는 Global-SPIL을 적용한다.
  • 두 모듈을 스택하여 먼저 Local-SPIL이 국소 포인트 상호작용을 정밀화하고, 그 다음 Global-SPIL이 모든 포인트를 아우르는 전반적 맥락을 정밀화한다.
  • 다중 헤드 메커니즘이 병렬로 다양한 유형의 상관관계 특징을 집계하여, 복잡한 운동 패턴을 포착하는 모델의 능력을 향상시킨다.
  • 프레임워크는 엔드 투 엔드 학습이 가능하며, 추가 데이터나 폭력에 대한 사전 지식이 필요하지 않다.

실험 결과

연구 질문

  • RQ1RGB 또는 옵티컬 플로우 특징보다 3D 스켈레톤 포인트 클라우드가 폭력 행동을 더 효과적으로 표현할 수 있는가?
  • RQ2복잡한 다인승 장면에서 스켈레톤 포인트 간의 국소 및 전반적 상호작용을 어떻게 모델링할 수 있는가?
  • RQ3무작위 순서의 포인트 클라우드에 적용된 자기주의 메커니즘이 스켈레톤 기반 폭력 인식에 적합한 순열 불변 특징 학습을 제공할 수 있는가?
  • RQ4제안된 SPIL 프레임워크가 다양한 폭력 인식 벤치마크에서 기존 최신 기술 수준(SOTA) 방법을 초월하는가?
  • RQ5스켈레톤 운동 신호만을 사용하여 비폭력적 신체 상호작용과 실제 폭력 행위를 구분할 수 있는가?

주요 결과

  • 제안된 LG-SPIL 모델은 네 개의 공개 비디오 폭력 데이터셋에서 새로운 최신 기술 수준(SOTA) 성능을 달성하며, 기존 방법을 압도한다.
  • 비폭력적 신체 상호작용의 오분류를 줄이기 위해 외관적 특징이 아닌 스켈레톤 운동 패턴에 집중함으로써 성능 향상을 이룬다.
  • Local-SPIL 모듈은 인근 스켈레톤 포인트 간의 의미적 관계와 공간-시간적 관계를 성공적으로 포착하여 국소 특징 표현을 향상시킨다.
  • Global-SPIL 모듈은 모든 스켈레톤 포인트 간의 장거리 종속성을 모델링하여 특징 학습을 향상시키고, 강건한 전반적 맥락 이해에 기여한다.
  • 단지 27.18M 파라미터와 35.26 GFLOPs로 높은 효율성을 유지하며, 4개의 2080Ti GPU에서 샘플당 0.32초 내에 추론를 수행한다.
  • 시각화 결과는 모델이 스켈레톤 포인트 간의 의미 있는 대응 관계를 학습하고 있으며, 폭력 행동 시 운동 관련 관절에 주의가 집중된다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.