Skip to main content
QUICK REVIEW

[논문 리뷰] A Novel Approach for Robust Multi Human Action Detection and Recognition based on 3-Dimentional Convolutional Neural Networks.

Noor Almaadeed, Omar Elharrouss|arXiv (Cornell University)|2019. 07. 25.
Human Pose and Action Recognition참고 문헌 57인용 수 11
한 줄 요약

이 논문은 개인별 행동 시퀀스 분석을 통해 시공간 특징을 모델링함으로써 감시 영상에서 다중 인물 행동 인식에 대해 강건한 3D 합성곱 신경망(3D-CNN) 아키텍처를 제안한다. 제안된 방법은 자체 제작한 다중 인물 데이터셋에서 98%의 정확도를 달성하였으며, 사전 처리 없이 UCF101, Hollywood2, HDMB51 및 YouTube에서 최신 기술을 초월한다.

ABSTRACT

In recent years, various attempts have been proposed to explore the use of spatial and temporal information for human action recognition using convolutional neural networks (CNNs). However, only a small number of methods are available for the recognition of many human actions performed by more than one person in the same surveillance video. This paper proposes a novel technique for multiple human action recognition using a new architecture based on 3Dimdenisional deep learning with application to video surveillance systems. The first stage of the model uses a new representation of the data by extracting the sequence of each person acting in the scene. An analysis of each sequence to detect the corresponding actions is also proposed. KTH, Weizmann and UCF-ARG datasets were used for training, new datasets were also constructed which include a number of persons having multiple actions were used for testing the proposed algorithm. The results of this work revealed that the proposed method provides more accurate multi human action recognition achieving 98%. Other videos were used for the evaluation including datasets (UCF101, Hollywood2, HDMB51, and YouTube) without any preprocessing and the results obtained suggest that our proposed method clearly improves the performances when compared to state-of-the-art methods.

연구 동기 및 목표

  • 여러 사람이 동시에 행동을 수행하는 혼잡한 감시 영상에서 다중 인물 행동 인식의 과제를 해결하기 위해.
  • 기존의 CNN 기반 방법들이 주로 단일 인물 또는 제한된 다중 인물 행동 인식에 집중하는 데서 비롯하는 한계를 극복하기 위해.
  • 복잡한 장면에서 다수의 액터 간 시공간 특징을 효과적으로 캡처할 수 있는 강건한 딥 러닝 프레임워크를 개발하기 위해.
  • 일반화 능력과 실제 적용 가능성을 보장하기 위해 표준 벤치마크와 새로 구축한 다중 인물 데이터셋 모두에서 방법을 평가하기 위해.

제안 방법

  • 영상 장면 내 각 개인의 행동 시퀀스를 추출하여 다중 인물 간 상호작용을 분리하는 새로운 데이터 표현을 구축하기 위해.
  • 추출된 개인별 행동 시퀀스에서 공간적 및 시간적 특징을 학습하기 위해 3D-CNN 아키텍처를 적용하기 위해.
  • 이중 단계 모델을 구현: 첫 번째 단계는 개인 시퀀스 추출, 두 번째 단계는 3D-CNN 분류를 통한 행동 인식.
  • KTH, Weizmann 및 UCF-ARG 데이터셋에서 모델을 훈련하고, 새로 제작한 다중 인물 행동 데이터셋에서 검증하기 위해.
  • UCF101, Hollywood2, HDMB51 및 YouTube와 같은 다양한 데이터셋에서 사전 처리 없이 평가하여 강건성 평가하기 위해.

실험 결과

연구 질문

  • RQ13D-CNN 기반 아키텍처는 혼잡하고 복잡한 감시 영상에서 다중 인물 행동 인식을 효과적으로 수행할 수 있는가?
  • RQ2제안된 개인별 시퀀스 기반 데이터 표현은 표준 영상 수준 모델링 대비 다중 인물 행동 인식 정확도를 얼마나 향상시키는가?
  • RQ3사전 처리 없이도 다양한 데이터셋 간 일반화 능력은 어느 정도 실현되는가?
  • RQ4기존 최신 기술 대비 제안된 방법은 다중 인물 행동 인식에서 어떤 성능 향상을 달성하는가?

주요 결과

  • 제안된 방법은 새로 제작한 다중 인물 행동 인식 데이터셋에서 98%의 정확도를 달성하여 복잡한 장면에서도 높은 강건성을 입증하였다.
  • UCF101, Hollywood2, HDMB51 및 YouTube 데이터셋에서 최신 기술 대비 성능 향상이 뚜렷하게 나타났다.
  • YouTube 및 기타 데이터셋에서 사전 처리 없이 평가된 점은 모델의 뛰어난 일반화 능력과 강건성을 강조한다.
  • 개인별 행동 시퀀스 표현의 사용은 다중 인물 시나리오에서 특징 학습을 향상시키고 인식 정확도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.