Skip to main content
QUICK REVIEW

[논문 리뷰] 3DV: 3D Dynamic Voxel for Action Recognition in Depth Video

Yancheng Wang, Yang Xiao|arXiv (Cornell University)|2020. 05. 12.
Human Pose and Action Recognition참고 문헌 55인용 수 4
한 줄 요약

이 논문은 3D 동적 복소 표현인 3DV를 제안한다. 3DV는 3D 복소화와 시간적 랭크 풀링을 통해 깊이 영상에서 시공간적 운동과 공간적 구조를 인코딩한다. PointNet++을 사용해 효율적인 엔드 투 엔드 동작 인식을 위한 점 집합으로 3DV를 모델링하며, NTU RGB+D 120에서 교차 주제 설정과 교차 설정 설정에서 각각 82.4% 및 93.5%의 정확도를 달성한다.

ABSTRACT

To facilitate depth-based 3D action recognition, 3D dynamic voxel (3DV) is proposed as a novel 3D motion representation. With 3D space voxelization, the key idea of 3DV is to encode 3D motion information within depth video into a regular voxel set (i.e., 3DV) compactly, via temporal rank pooling. Each available 3DV voxel intrinsically involves 3D spatial and motion feature jointly. 3DV is then abstracted as a point set and input into PointNet++ for 3D action recognition, in the end-to-end learning way. The intuition for transferring 3DV into the point set form is that, PointNet++ is lightweight and effective for deep feature learning towards point set. Since 3DV may lose appearance clue, a multi-stream 3D action recognition manner is also proposed to learn motion and appearance feature jointly. To extract richer temporal order information of actions, we also divide the depth video into temporal splits and encode this procedure in 3DV integrally. The extensive experiments on 4 well-established benchmark datasets demonstrate the superiority of our proposition. Impressively, we acquire the accuracy of 82.4% and 93.5% on NTU RGB+D 120 [13] with the cross-subject and crosssetup test setting respectively. 3DV's code is available at https://github.com/3huo/3DV-Action.

연구 동기 및 목표

  • 깊이 영상에서 3D 공간적 구조와 운동 패턴을 포착하는 데에 2D 운동 표현 방식의 한계를 해결하기 위해.
  • 공간적 위치와 시간적 운동 순서를 동시에 인코딩하는 압축형이고 3D 인지 가능한 운동 표현을 개발하기 위해.
  • 가벼운 딥러닝을 위한 3DV를 점 집합으로 변환함으로써 효율적이고 효과적인 3D 동작 인식을 가능하게 하기 위해.
  • 다중 스트림 학습 프레임워크를 통해 3D 운동 및 깊이 외관 특징을 융합하여 성능을 향상시키기 위해.
  • 더 풍부한 동작 시퀀스 특징 표현을 위해 시간적 분할을 3DV 표현에 통합하여 시간 모델링을 향상시키기 위해.

제안 방법

  • 각 깊이 프레임을 정규 격자(예: 50×50×50)로 3D 공간을 복소화하여 이진 점유 격자로 표현한다.
  • 연속된 깊이 프레임에 대해 시간적 랭크 풀링을 적용하여 이진 복소 집합의 시퀀스를 단일 3DV 표현으로 압축한다.
  • 각 3DV 복소는 해당 3D 운동 성분의 시간적 순서를 나타내는 운동 값을 저장하며, 후행하는 운동일수록 높은 값이 된다.
  • 3DV 표현을 점 집합으로 변환하여 각 복소를 3D 좌표와 운동 값을 가진 점으로 표현하며, PointNet++ 입력에 적합하게 한다.
  • 모션 스트림(3DV 입력)과 여러 외관 스트림(원본 깊이 프레임)을 포함하는 다중 스트림 네트워크를 설계하여 모션 및 외관 특징을 공동으로 학습한다.
  • 깊이 영상의 시간적 분할을 사용하여 시간 순서 모델링을 향상시키며, 모든 분할의 운동 값들을 3DV 표현에 융합한다.

실험 결과

연구 질문

  • RQ1공간적 위치와 시간적 운동 순서를 동시에 인코딩하는 3D 운동 표현이 깊이 영상에서 3D 동작 인식 성능을 향상시키는가?
  • RQ2PointNet++와 같은 경량 점 기반 네트워크와 함께 사용할 때 3DV가 압축형이고 3D 인지 가능한 표현으로서 얼마나 효과적인가?
  • RQ3모션 특징과 외관 특징을 융합함으로써 모션 전용 표현에 비해 정확도 향상 정도는 어느 정도인가?
  • RQ4다양한 3DV 복소 크기와 샘플링 점 수는 인식 성능와 모델 효율성에 어떤 영향을 미치는가?
  • RQ5시간적 분할 통합이 복잡한 동작 시퀀스의 모델링에 3D 동작 인식에서 향상되는가?

주요 결과

  • 교차 주제 설정에서 NTU RGB+D 120에서 3DV는 82.4%의 정확도를 달성하며 기존 방법들을 능가한다.
  • NTU RGB+D 120의 교차 설정 설정에서 3DV는 93.5%의 정확도를 기록하여 뛰어난 일반화 능력을 입증한다.
  • 최적의 3DV 복소 크기는 35×35×35 mm로 확인되었으며, 이는 교차 주제 설정에서 76.9%, 교차 시야 설정에서 92.5%의 정확도를 제공한다.
  • PointNet++에 2048개의 샘플링 점을 사용할 경우 최고의 성능을 기록하였으며, 교차 주제 설정에서 76.9%, 교차 시야 설정에서 92.5%의 정확도를 달성했다.
  • 근사화된 시간적 랭크 풀링 방법은 3DV 추출 시간을 1.12초에서 0.10초로 단축시켰으며 정확도 저하가 최소 수준(95.8% 대비 95.3%)이었다.
  • PointNet++는 정확도와 효율성 면에서 C3D를 능가했다: NTU RGB+D 60(교차 시야)에서 90.0% 대비 85.0%, 파라미터 수 1.24M 대비 29.2M, 연산 수 1.24G FLOPs 대비 10.99G.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.