Skip to main content
QUICK REVIEW

[논문 리뷰] A Novel Approach for Robust Multi Human Action Recognition and Summarization based on 3D Convolutional Neural Networks

Noor Almaadeed, Omar Elharrouss|arXiv (Cornell University)|2019. 07. 25.
Human Pose and Action Recognition인용 수 8
한 줄 요약

이 논문은 사전 처리가 필요 없는 감시 및 웹 기반 영상에서 다중 인물 행동 인식 및 영상 요약을 위한 3D CNN 기반 프레임워크를 제안한다. 영상에서 개별 행동 시퀀스를 추출하고, 3D CNN을 적용하여 행동 검출을 수행하며, 행동 중심 요약을 생성하여 UCF101 및 YouTube 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Human actions in videos are 3D signals. However, there are a few methods available for multiple human action recognition. For long videos, it's difficult to search within a video for a specific action and/or person. For that, this paper proposes a new technic for multiple human action recognition and summarization for surveillance videos. The proposed approach proposes a new representation of the data by extracting the sequence of each person from the scene. This is followed by an analysis of each sequence to detect and recognize the corresponding actions using 3D convolutional neural networks (3DCNNs). Action-based video summarization is performed by saving each person's action at each time of the video. Results of this work revealed that the proposed method provides accurate multi human action recognition that easily used for summarization of any action. Further, for other videos that can be collected from the internet, which are complex and not built for surveillance applications, the proposed model was evaluated on some datasets like UCF101 and YouTube without any preprocessing. For this category of videos, the summarization is performed on the video sequences by summarizing the actions in each subsequence. The results obtained demonstrate its efficiency compared to state-of-the-art methods.

연구 동기 및 목표

  • 긴 감시 영상에서 여러 사람이 수행하는 행동을 식별하고 요약하는 데 도전하는 데 목적이 있다.
  • 긴 영상 콘텐츠 내에서 특정 행동이나 개인을 효율적으로 검색하고 검색할 수 있는 방법을 개발하는 데 목적이 있다.
  • UCF101 및 YouTube와 같은 인터넷에서의 복잡하고 비정형 영상에 대해 행동 인식 모델의 적용 가능성을 확장하는 데 목적이 있다.
  • 각 개인의 핵심 사건을 유지하는 압축형, 행동 기반 영상 요약을 생성하는 데 목적이 있다.

제안 방법

  • 개별 인물의 행동 시퀀스를 사람별로 공간-시간 추적을 사용하여 영상 프레임에서 추출한다.
  • 각 추출된 시퀀스에서 스펙트럴-시간 특징을 학습하기 위해 3D 컨volution 신경망(3DCNNs)을 적용한다.
  • 행동 기반 영상 요약은 각 개인별로 관련 타임스탬프에 키 행동 클립을 선택하고 유지함으로써 수행된다.
  • 프레임워크는 UCF101 및 YouTube의 사전 처리되지 않은 영상에서 평가되어 사전 처리 없이도 강건성을 입증한다.
  • 이 프레임워크는 감시 영상 요약과 비구조화된 환경에서의 일반 영상 이해를 모두 지원한다.

실험 결과

연구 질문

  • RQ13D CNN 기반 방법이 사전 분할된 데이터에 의존하지 않고도 긴 감시 영상에서 다중 인물 행동 인식을 정확하게 수행할 수 있는가?
  • RQ2제안된 방법은 비구조화된 웹 영상에서 여러 인물의 행동을 요약하는 데 얼마나 효과적인가?
  • RQ3모델이 UCF101 및 YouTube와 같은 복잡하고 비구조화된 영상에 대해 사전 처리 없이 얼마나 일반화되는가?
  • RQ4행동 기반 요약 기술은 특정 행동이나 사람을 위한 효율적인 영상 검색 및 검색을 가능하게 하는가?

주요 결과

  • 제안된 방법은 영상 사전 처리가 전혀 필요 없이 UCF101 및 YouTube 데이터셋에서 다중 인물 행동 인식 분야에서 최신 기술 수준의 성능을 달성한다.
  • 모델은 긴 감시 영상에서 행동을 성공적으로 인식하고 각 개인별 정확한 행동 중심 요약을 생성한다.
  • 이 방법은 원래 감시 응용을 위한 것으로 설계되지 않은 복잡하고 비구조화된 영상 환경에서도 강건성을 보여준다.
  • 행동 기반 요약은 각 개인별로 가장 관련성이 높은 행동 세그먼트만 유지하므로 효율적인 영상 탐색을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.