Skip to main content
QUICK REVIEW

[논문 리뷰] DAP3D-Net: Where, What and How Actions Occur in Videos?

Li Liu, Yi Zhou|arXiv (Cornell University)|2016. 02. 10.
Human Pose and Action Recognition참고 문헌 56인용 수 6
한 줄 요약

이 논문은 비디오에서 동작 로컬라이제이션, 분류, 계층적 운동 속성 학습을 동시에 수행하는 다중 작업 3D 합성곱 신경망인 DAP3D-Net을 제안한다. 새로운 대규모 합성 데이터셋(NASA)에서 외관 및 옵티컬 플로우 입력을 활용하고 실제 데이터셋(HAU)에서 평가함으로써, DAP3D-Net은 동작 검출 및 속성 예측에서 최신 기술 수준의 성능을 달성하였으며, 로컬라이제이션 정확도는 3.4%~5.3% 향상되고, 속성 학습의 AUC는 최대 34.2% 향상되었다.

ABSTRACT

Action parsing in videos with complex scenes is an interesting but challenging task in computer vision. In this paper, we propose a generic 3D convolutional neural network in a multi-task learning manner for effective Deep Action Parsing (DAP3D-Net) in videos. Particularly, in the training phase, action localization, classification and attributes learning can be jointly optimized on our appearancemotion data via DAP3D-Net. For an upcoming test video, we can describe each individual action in the video simultaneously as: Where the action occurs, What the action is and How the action is performed. To well demonstrate the effectiveness of the proposed DAP3D-Net, we also contribute a new Numerous-category Aligned Synthetic Action dataset, i.e., NASA, which consists of 200; 000 action clips of more than 300 categories and with 33 pre-defined action attributes in two hierarchical levels (i.e., low-level attributes of basic body part movements and high-level attributes related to action motion). We learn DAP3D-Net using the NASA dataset and then evaluate it on our collected Human Action Understanding (HAU) dataset. Experimental results show that our approach can accurately localize, categorize and describe multiple actions in realistic videos.

연구 동기 및 목표

  • 복잡한 비디오 동작 해석 문제를 동시에 해결하기 위해 동작 로컬라이제이션, 분류, 운동 속성 학습을 통합적으로 해결하고자 한다.
  • 로컬라이제이션, 분류, 속성 기술 간의 상호의존성을 모델링하는 통합된 딥 러닝 프레임워크를 개발하고자 한다.
  • 200,000개의 클립을 포함하고 300개 이상의 카테고리와 33개의 계층적 속성을 가진 대규모이고 잘 레이블링된 합성 데이터셋(NASA)을 구축하고자 한다.
  • 실제 인간 행동 이해 데이터셋(HAU)에서 지도 위치, 카테고리, 속성을 포함하여 모델을 평가하고자 한다.
  • 3D CNN을 사용한 다중 작업 학습이 단일 작업 또는 독립적 학습 방식보다 성능 향상에 기여함을 입증하고자 한다.

제안 방법

  • DAP3D-Net은 공간-시간 모델링을 위해 외관(RGB)과 운동(옵티컬 플로우) 특징을 입력으로 사용하는 3D 합성곱 신경망 아키텍처를 채택한다.
  • 모델은 동작 로컬라이제이션(박스 회귀), 동작 분류(소프트맥스), 계층적 속성 예측(H1: 저수준 신체 부위 운동; H2: 고수준 운동 패턴)의 세 가지 헤드를 동시에 최적화하여 다중 작업 학습을 수행한다.
  • 두 단계의 계층적 속성 학습 체계를 사용하여, 저수준 및 고수준 속성을 각기 다른 완전 연결층(FC1 및 FC2)에서 예측함으로써 표현 학습을 향상시킨다.
  • 분류, 로컬라이제이션, 속성 예측 손실을 조합한 통합 손실 함수를 사용하여 네트워크를 엔드 투 엔드로 훈련시킨다.
  • 사전 훈련된 C3D 모델의 특징을 활용하여 HAU 데이터셋에서 네트워크를 피지컬 튜닝함으로써 전이 학습을 적용한다.
  • 후처리로는 경계 상자 정밀화를 위한 경계 상자 회귀기(BBR)와 비교를 위한 추출된 특징에 대한 선택적 SVM 분류를 수행한다.

실험 결과

연구 질문

  • RQ1통합된 딥 러닝 프레임워크는 복잡한 비디오 장면에서 동작 로컬라이제이션, 분류, 운동 속성 학습이라는 세 가지 상호 연관된 문제를 효과적으로 해결할 수 있는가?
  • RQ23D CNN 아키텍처에서의 공동 다중 작업 학습은 단일 작업 또는 독립적 학습 방식에 비해 동작 해석 성능에서 어떻게 비교되는가?
  • RQ3외관 입력에 비해 옵티컬 플로우를 운동 입력으로 사용할 경우, 동작 로컬라이제이션 및 속성 예측 성능 향상 정도는 어느 정도인가?
  • RQ4제안된 계층적 속성 학습 체계(H1 및 H2)는 단일 레이어에서 모든 속성을 학습하는 것에 비해 얼마나 효과적인가?
  • RQ5모델은 실제 비디오에 일반화되어 있으며, 동작 검출 및 속성 예측에서 최신 기술 수준의 방법들을 초월할 수 있는가?

주요 결과

  • DAP3D-Net 2 + Ft는 소프트맥스 분류기를 사용할 때 HAU 데이터셋에서 평균 정밀도(mAP) 70.6%를 달성하여 선형 SVM를 사용한 베이스라인을 능가한다.
  • 경계 상자 회귀기(BBR)를 포함시킴으로써 DAP3D-Net에서 BBR를 사용하지 않은 경우에 비해 동작 검출 mAP가 3.4%~5.3% 향상된다.
  • DAP3D-Net 2 + Ft는 저수준 속성(H1)에 대해 32.5% 향상되고 고수준 속성(H2)에 대해 34.2% 향상된 AUC 성능을 기록하였다.
  • FC1 및 FC2에서 각각 H1 및 H2를 예측하는 계층적 속성 학습 체계는 모든 33개의 속성을 하나의 레이어(예: FC2)에서 학습하는 것보다 높은 AUC 및 히트율(17/19 for H1, 12/14 for H2)을 기록하여 우월한 성능을 보였다.
  • DAP3D-Net 2에서 추출한 특징에 선형 SVM를 적용하면 소프트맥스보다 1% mAP 향상이지만, 600프레임 비디오당 총 검출 시간이 158.67초로 증가하여 엔드 투 엔드 소프트맥스 접근 방식이 더 효율적이다.
  • 정성적 결과(그림 8)에서 모델은 정확한 경계 상자로 동작을 성공적으로 로컬라이징하고 동시에 동작 카테고리와 운동 속성을 예측하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.