Skip to main content
QUICK REVIEW

[논문 리뷰] Faster VoxelPose: Real-time 3D Human Pose Estimation by Orthographic Projection

Hang Ye, Wentao Zhu|arXiv (Cornell University)|2022. 07. 22.
Human Pose and Action Recognition인용 수 5
한 줄 요약

Faster VoxelPose는 3D 특징 볼륨을 2D 정사영 평면(xy, xz, yz)에 재투영하여 3D-CNN 대신 효율적인 2D-CNN 기반 관절 좌표 추정을 가능하게 함으로써 실시간 3D 인간 자세 추정 방법을 제안한다. 이는 VoxelPose 대비 약 10배의 속도 향상을 달성하면서도 최신 기준 정확도를 유지하며, 3D 인간 검출기와 적응형 융합을 통해 투영 간 모호함과 일관성 없는 예측을 해결한다.

ABSTRACT

While the voxel-based methods have achieved promising results for multi-person 3D pose estimation from multi-cameras, they suffer from heavy computation burdens, especially for large scenes. We present Faster VoxelPose to address the challenge by re-projecting the feature volume to the three two-dimensional coordinate planes and estimating X, Y, Z coordinates from them separately. To that end, we first localize each person by a 3D bounding box by estimating a 2D box and its height based on the volume features projected to the xy-plane and z-axis, respectively. Then for each person, we estimate partial joint coordinates from the three coordinate planes separately which are then fused to obtain the final 3D pose. The method is free from costly 3D-CNNs and improves the speed of VoxelPose by ten times and meanwhile achieves competitive accuracy as the state-of-the-art methods, proving its potential in real-time applications.

연구 동기 및 목표

  • 다중 시점 3D 인간 자세 추정에서 3D-CNN 기반 볼륨 방법의 높은 계산 비용을 해결하기 위해, 특히 대규모 장면에서의 효율성을 확보한다.
  • 정사영 특징 재투영을 통해 고비용 3D 컨벌루션을 효율적인 2D-CNN으로 대체하여 실시간 추론을 가능하게 한다.
  • 긴밀한 경계 상자로 구성된 학습된 3D 인간 검출 네트워크(HDN)를 사용하여 2D 투영에서 겹치는 사람들의 모호함을 제거한다.
  • 검출된 3D 경계 상자 내에서 특징 볼륨을 마스킹하여 각 사람의 특징 볼륨을 고립시켜 간섭을 줄인다.
  • 불일치한 예측을 해결하기 위해 신뢰도 기반 융합 네트워크를 개발한다.

제안 방법

  • 정사영 투영을 사용하여 융합된 3D 특징 볼륨을 세 개의 2D 좌표 평면(xy, xz, yz)에 재투영하여 2D-CNN 처리를 가능하게 한다.
  • 인간 검출 네트워크(HDN)를 사용하여 xy 평면 상의 2D 경계 상자로 각 사람의 위치를 국지화하고, z축 컬럼 특징에 대한 1D-CNN을 통해 키를 추정한다.
  • 검출된 3D 경계 상자 내에서 사람별로 특징 볼륨을 마스킹하여 다른 사람들의 간섭을 줄인다.
  • 각 2D 투영 평면에서 전용 2D-CNN를 사용하여 부분적인 3D 좌표(X, Y, Z)를 추정하여 각 좌표에 대해 두 개의 추정치를 생성한다.
  • 학습 가능한 가중치 융합 네트워크를 사용하여 이중 평면 예측을 융합하며, 불일치를 줄이기 위해 예측에 대한 신뢰도 가중치를 할당한다.
  • 조정 가능한 볼륨 해상도를 통해 속도와 정확도의 균형을 맞추며, 계산 복잡도가 세제곱에서 제곱으로 스케일링된다.

실험 결과

연구 질문

  • RQ1정사영 투영을 통해 3D-CNN을 2D-CNN로 대체함으로써 3D 인간 자세 추정의 속도를 크게 향상시킬 수 있을까? 정확도 손실 없이 가능할까?
  • RQ2대규모 장면에서 겹치는 사람들의 2D 투영에서 관절 국지화 시 모호함을 어떻게 제거할 수 있을까?
  • RQ3지면 평면 국지화와 높이 추정을 분리한 3D 인간 검출기(HDN)가 특징 마스킹과 자세 정확도 향상에 기여할 수 있을까?
  • RQ4다양한 2D 투영에서 발생하는 불일치한 예측을 효과적으로 융합하여 신뢰할 수 있는 3D 관절 좌표를 생성할 수 있을까?
  • RQ5이 방법은 카메라 수와 사람 수가 증가함에 따라 대규모로 혼잡한 장면에 얼마나 잘 스케일링될까?

주요 결과

  • Faster VoxelPose는 표준 벤치마크에서 VoxelPose 대비 10배의 속도 향상을 달성하면서도 경쟁력 있는 정확도를 유지하며, CMU Panoptic에서 MPJPE는 18.26mm를 기록했다.
  • 제거 실험 결과, 특징 마스킹이 AP50를 96.75%에서 98.08%로 향상시켜 상호 사람 간 간섭 감소에 기여함을 확인했다.
  • 적응형 가중치 융합이 평균 융합 대비 MPJPE를 20.11mm에서 18.26mm로 감소시켜 신뢰도 기반 집합의 효과를 입증했다.
  • 더러운 볼륨(32×32×32)을 사용할 경우 MACs가 8.67G에서 2.17G로 75% 감소했고, MPJPE는 단지 2.1mm 증가하여 속도-정확도 트레이드오���을 가능하게 했다.
  • 8m×8m 장면에서 16m×16m 장면으로 확장할 경우 카메라 수가 12대에 달하더라도 추론 시간이 오직 28.8% 증가하여 기존 방법 대비 뛰어난 확장성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.