Skip to main content
QUICK REVIEW

[논문 리뷰] Holistic Planimetric prediction to Local Volumetric prediction for 3D Human Pose Estimation

Gyeongsik Moon, Ju Yong Chang|arXiv (Cornell University)|2017. 06. 15.
Human Pose and Action Recognition참고 문헌 31인용 수 15
한 줄 요약

이 논문은 단일 깊이 맵에서 3D 인간 자세 추정을 위한 이단계적 방법을 제안한다. 전역적인 2D 평면 예측을 먼저 수행한 후, 3D 컨volution 네트워크(3D CNN)를 이용해 局소적인 3D 부피 예측을 수행함으로써 정확도를 향상시키면서도 계산 비용을 관리한다. 제안된 방법은 공개 데이터셋에서 최신 기술보다 큰 성능 향상을 이룩하며, 3D 점유 그리드 상에서의 1체소 단위 가능성 추정을 통해 뛰어난 성능을 달성한다.

ABSTRACT

We propose a novel approach to 3D human pose estimation from a single depth map. Recently, convolutional neural network (CNN) has become a powerful paradigm in computer vision. Many of computer vision tasks have benefited from CNNs, however, the conventional approach to directly regress 3D body joint locations from an image does not yield a noticeably improved performance. In contrast, we formulate the problem as estimating per-voxel likelihood of key body joints from a 3D occupancy grid. We argue that learning a mapping from volumetric input to volumetric output with 3D convolution consistently improves the accuracy when compared to learning a regression from depth map to 3D joint coordinates. We propose a two-stage approach to reduce the computational overhead caused by volumetric representation and 3D convolution: Holistic 2D prediction and Local 3D prediction. In the first stage, Planimetric Network (P-Net) estimates per-pixel likelihood for each body joint in the holistic 2D space. In the second stage, Volumetric Network (V-Net) estimates the per-voxel likelihood of each body joints in the local 3D space around the 2D estimations of the first stage, effectively reducing the computational cost. Our model outperforms existing methods by a large margin in publicly available datasets.

연구 동기 및 목표

  • 비선형적인 특징-좌표 매핑으로 인해 직접적인 2D에서 3D 좌표 회귀 방식이 3D 인간 자세 추정에서 성능이 열 劣하는 문제를 해결하기 위해.
  • 3D 컨볼루션과 부피 표현 방식이 3D 자세 추정에서 높은 계산 비용을 유발하는 문제를 해결하기 위해.
  • 3D 점유 그리드 상에서 각 체질 관절의 1체소 단위 가능성 모델링을 통해 국소화 정확도를 향상시키기 위해.
  • 전체적인 2D 추정 단계와 국소적인 3D 보정 단계로 작업을 분리함으로써 계산 오버헤드를 감소시키기 위해.
  • 확장 가능하고 효율적인 아키텍처를 사용해 단일 깊이 맵에서 정확한 3D 자세 추정을 가능하게 하기 위해.

제안 방법

  • 입력 깊이 맵을 3D 점유 그리드로 표현하여 1체소 단위 가능성 추정을 위한 3D 컨볼루션 처리를 가능하게 한다.
  • 전체 2D 공간에서 각 신체 관절에 대한 1픽셀 단위 가능성 맵을 예측하기 위해 2D 컨volution 네트워크인 Planimetric Network(P-Net)를 사용한다.
  • P-Net의 2D 관절 예측 중심으로 국소적인 3D 시야(점유 그리드)를 생성하여 3D 탐색 공간을 축소한다.
  • 국소적인 3D 영역에서 1체소 단위 가능성 추정을 통해 예측을 보정하기 위해 3D 컨볼루션 네트워크인 Volumetric Network(V-Net)를 적용한다.
  • 각 관절에 대해 1체소 단위 가능성 감독을 사용하여 훈련함으로써 좌표 회귀보다 richer한 감독을 가능하게 한다.
  • P-Net의 출력을 활용해 V-Net의 입력을 제약함으로써 3D 추론의 계산 비용을 크게 감소시킨다.

실험 결과

연구 질문

  • RQ13D 점유 그리드 상에서 1체소 단위 가능성 추정 방식이 직접적인 2D에서 3D 좌표 회귀 방식보다 3D 인간 자세 추정 정확도를 향상시키는가?
  • RQ2전체적인 2D 예측 이후 국소적인 3D 보정을 수행하는 이단계적 접근 방식이 계산 비용을 효과적으로 줄이면서도 정확도를 유지하거나 향상시키는가?
  • RQ3초기 2D 추정 성능(P-Net)이 특히 가림을 받는 관절(예: 팔꿈치, 손)의 최종 3D 자세 정확도에 어떤 영향을 미치는가?
  • RQ4국소적인 3D 보정 단계에서 전역적 맥락의 부재가 어려운 관절에 대한 성능을 어느 정도 제한하는가?
  • RQ5반복적 보정 없이도 제안된 방법이 표준 벤치마크에서 기존 최신 기술(SOTA)을 능가할 수 있는가?

주요 결과

  • 제안된 방법은 ITOP 및 EVAL 데이터셋 모두에서 기존 최신 기술(SOTA)을 크게 앞서는 성능을 달성한다.
  • 10cm 기준으로 ITOP 데이터셋에서 mAP 87.5%와 EVAL 데이터셋에서 mAP 89.1%를 기록한다.
  • 반복적 보정 없이도 프레임당 0.28초의 속도를 달성하여 Haque 등 [10]의 1.7초/프레임보다 빠르게 작동한다.
  • V-Net을 진짜 2D 관절 위치를 사용해 훈련 및 테스트할 경우, EVAL 및 ITOP 데이터셋에서 팔꿈치와 손의 성능이 각각 14.7점과 9.9점 향상되며, 이는 P-Net의 2D 추정이 핵심적 한계임을 시사한다.
  • 더 큰 국소 패치(최대 40×40×40)는 성능을 약간 향상시키지만, 수용체 필드와 GPU 메모리 제약으로 인해 32×32×32를 초과하면 성능 향상이 정체된다.
  • ITOP 데이터셋에서의 정성적 결과는 비가림 영역에서는 신체 관절의 정확한 국소화를 보여주며, 팔꿈치와 손에서는 특히 도전적인 문제를 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.