Skip to main content
QUICK REVIEW

[논문 리뷰] Aggressive actions and anger detection from multiple modalities using Kinect

Amol Patwardhan, Gerald M. Knapp|arXiv (Cornell University)|2016. 07. 04.
Anomaly Detection Techniques and Applications인용 수 10
한 줄 요약

이 논문은 킬리킨을 사용하여 얼굴 표정, 머리 및 몸의 움직임, 손짓, 음성 신호를 융합함으로써 실시간으로 분노와 공격적 행동을 탐지하는 다중모달 시스템을 제안한다. 규칙 기반 행동 특징과 서포트 벡터 머신을 결합한 접근 방식은 단모달 방법 대비 분노 탐지 정밀도를 15.2% 향상시키고 재현율을 11.7% 향상시켰으며, 감시 시스템의 반응성을 제재소나 스포츠 바와 같은 고위험 환경에서 향상시켰다.

ABSTRACT

Prison facilities, mental correctional institutions, sports bars and places of public protest are prone to sudden violence and conflicts. Surveillance systems play an important role in mitigation of hostile behavior and improvement of security by detecting such provocative and aggressive activities. This research proposed using automatic aggressive behavior and anger detection to improve the effectiveness of the surveillance systems. An emotion and aggression aware component will make the surveillance system highly responsive and capable of alerting the security guards in real time. This research proposed facial expression, head, hand and body movement and speech tracking for detecting anger and aggressive actions. Recognition was achieved using support vector machines and rule based features. The multimodal affect recognition precision rate for anger improved by 15.2% and recall rate improved by 11.7% when behavioral rule based features were used in aggressive action detection.

연구 동기 및 목표

  • 감시 시스템의 반응성을 제재소, 정신건강 시설, 스포츠 바와 같은 고위험 공공 환경에서 분노 및 공격적 행동을 실시간으로 향상시키기 위해 개선한다.
  • 킬리킨에서 유래한 시각적 및 청각적 신호를 통합하여 향상된 행동 분석을 위한 다중모달 정서 인식 시스템을 개발한다.
  • 규칙 기반 행동 특징이 분노 및 공격적 행동 탐지 성능 향상에 기여하는지 평가한다.
  • 적극적인 경고를 통해 보안 인력이 공격의 조짐을 조기에 인식할 수 있도록 감시 시스템을 구현한다.
  • 다양한 모달리티를 융합함으로써 단모달 접근 방식보다 분노 탐지 정확도가 크게 향상됨을 입증한다.

제안 방법

  • 시스템은 마이크로소프트 킬리킨을 사용하여 RGB 영상, 깊이 맵, 오디오 스트림을 포함한 다중모달 데이터를 캡처한다.
  • 얼굴 표정은 얼굴 랜드마크 검출 및 정서 분류 모델을 사용하여 분석된다.
  • 헤드, 핸드, 바디의 움직임은 킬리킨 센서에서 유도된 뼈대 관절 데이터를 사용하여 추적된다.
  • 피치, 에너지, 말하기 속도와 같은 음성 특징이 분노의 청각적 징후를 탐지하기 위해 추출된다.
  • 빠른 손짓이나 갑작스러운 움직임과 같은 공격적 행동 패턴을 모델링하기 위해 규칙 기반 특징이 설계된다.
  • 분노 및 공격적 행동을 분류하기 위해 융합된 다중모달 특징을 기반으로 서포트 벡터 머신(SVMs)이 학습된다.

실험 결과

연구 질문

  • RQ1얼굴, 운동, 음성 신호의 다중모달 융합이 단모달 접근 방식을 초월하여 분노 및 공격적 행동 탐지 성능을 향상시킬 수 있는가?
  • RQ2실제 감시 환경에서 규칙 기반 행동 특징이 탐지 성능 향상에 어느 정도 영향을 미치는가?
  • RQ3킬리킨에서 유도된 데이터 통합이 분노 탐지 시스템의 정밀도와 재현율을 어떻게 향상시키는가?
  • RQ4소비자용 깊이 및 운동 센서를 사용하여 공격적 행동의 실시간 탐지가 신뢰성 있게 이뤄질 수 있는가?
  • RQ5얼굴 표정, 신체 운동, 또는 음성 중 각 모달리티가 전체 탐지 정확도에 기여하는 상대적 기여도는 얼마인가?

주요 결과

  • 규칙 기반 행동 특징의 통합으로 기준 모델 대비 분노 탐지 정밀도가 15.2% 향상되었다.
  • 규칙 기반 특징이 다중모달 시스템에 통합된 후 분노 탐지 재현율이 11.7% 향상되었다.
  • 얼굴, 운동, 음성 신호의 다중모달 융합은 정밀도 및 재현율 측면에서 단모달 탐지보다 뛰어난 성능을 보였다.
  • 시스템은 제재소나 스포츠 바와 같은 고위험 환경에서 실시간 구현 가능성을 입증했다.
  • 얼굴 표정과 신체 운동 특징이 탐지 성능 향상에 가장 크게 기여했다.
  • 융합된 다중모달 특징을 기반으로 학습된 서포트 벡터 머신 분류기는 뛰어난 분류 정확도를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.