Skip to main content
QUICK REVIEW

[논문 리뷰] DRPose3D: Depth Ranking in 3D Human Pose Estimation

Min Wang, Xipeng Chen|arXiv (Cornell University)|2018. 05. 23.
Human Pose and Action Recognition참고 문헌 20인용 수 10
한 줄 요약

DRPose3D는 관절 간 깊이 순서를 학습하는 쌍별 깊이 순서( pairwise depth ranking)를 기하학적 사전 지식으로 활용하여 3D 자세 회귀 성능을 향상시키는 이단계 3D 인간 자세 추정 방법을 제안한다. 쌍별 순서를 예측하는 Pairwise Ranking CNN( PRCNN)과 2D 관절과 함께 이를 조합하는 코arse-to-fine 3D 자세 네트워크(DPNet)를 사용함으로써, Human3.6M에서 최신 기술 성능을 달성하여 MPJPE를 Protocol #1 기준 57.8mm, Protocol #2 기준 42.9mm, Protocol #3 기준 62.8mm로 저감하였으며, Protocol #1과 #3 간의 MPJPE 격차를 59.7% 감소시켰다.

ABSTRACT

In this paper, we propose a two-stage depth ranking based method (DRPose3D) to tackle the problem of 3D human pose estimation. Instead of accurate 3D positions, the depth ranking can be identified by human intuitively and learned using the deep neural network more easily by solving classification problems. Moreover, depth ranking contains rich 3D information. It prevents the 2D-to-3D pose regression in two-stage methods from being ill-posed. In our method, firstly, we design a Pairwise Ranking Convolutional Neural Network (PRCNN) to extract depth rankings of human joints from images. Secondly, a coarse-to-fine 3D Pose Network(DPNet) is proposed to estimate 3D poses from both depth rankings and 2D human joint locations. Additionally, to improve the generality of our model, we introduce a statistical method to augment depth rankings. Our approach outperforms the state-of-the-art methods in the Human3.6M benchmark for all three testing protocols, indicating that depth ranking is an essential geometric feature which can be learned to improve the 3D pose estimation.

연구 동기 및 목표

  • 이단계 방법에서 2D에서 3D 자세로의 회귀가 불완전한 문제를 해결하기 위해 깊이 순서를 학습 가능한 기하학적 사전 지식으로 도입한다.
  • 절대 3D 좌표보다 더 직관적이고 학습하기 쉬운 깊이 순서에 담긴 풍부한 3D 구조적 정보를 활용하여 3D 자세 추정 정확도를 향상시킨다.
  • 가상 카메라 시야를 합성하고 깊이 순서에 통계적 노이즈를 적용하여 3D 공간에서 효과적인 데이터 증강을 가능하게 하여 모델의 일반화 능력을 향상시킨다.
  • 깊이 순서가 3D 자세 추정 성능을 크게 향상시키는 강력하고 학습 가능하며 증강 가능한 기하학적 특징임을 입증한다.

제안 방법

  • 모든 관절 쌍 간의 깊이 순서를 예측하기 위해 이진 분류 작업으로 간주하는 Pairwise Ranking Convolutional Neural Network( PRCNN)을 설계하여 깊이 관계 행렬을 생성한다.
  • PRCNN는 RGB 이미지와 2D 히트맵 특징을 입력으로 사용하며, 관절 쌍을 비교하여 z축 기준으로 한 관절이 다른 관절보다 앞서 있는지 여부를 출력하는 시아미즈 유사 아키텍처를 사용한다.
  • 코어스-투-파인 3D 자세 네트워크(DPNet)를 제안하며, 이는 DepthNet과 PoseNet으로 구성된다. DepthNet은 먼저 대부분의 깊이 순서와 일치하는 코어스 깊이 값을 추정한 후, 최적화 단계에서 3D 자세를 정밀하게 보정한다.
  • 일반화 능력을 향상시키기 위해 3D 자세와 카메라 파라미터를 합성하여 가상 시야에서 실재적인 2D 관절 위치와 깊이 순서 행렬을 생성하는 통계적 데이터 증강 방법을 도입한다.
  • 주변의 주제를 중심으로 원형 카메라 샘플링 전략을 사용하여 다양한 시야를 시뮬레이션하고, 실제 데이터 분포와 일치시키기 위해 순서 행렬에 노이즈를 추가한다.
  • 최종 3D 자세는 2D 관절 위치와 깊이 순서 행렬을 조합하여 회귀하며, DPNet은 순서 예측의 노이즈를 효과적으로 감소시킨다.

실험 결과

연구 질문

  • RQ12D에서 3D 자세로의 회귀에서 직접 3D 회귀보다 깊이 순서가 더 강력하고 학습 가능한 기하학적 사전 지식이 될 수 있는가?
  • RQ2깊이 순서를 통합함으로써 이단계 3D 자세 추정 모델의 성능과 일반화 능력은 어떻게 향상되는가?
  • RQ3깊이 순서를 활용하여 3D 공간에서 효과적인 데이터 증강을 수행할 수 있으며, 이는 새로운 카메라 각도에 대한 모델의 강인성 향상에 기여하는가?
  • RQ4DPNet의 코어스-투-파인 정밀 조정 과정이 노이즈가 있는 깊이 순서 예측의 영향을 얼마나 줄이는가?
  • RQ5단일 이미지에서 깊이 순서를 학습하는 것이 엔드 투 엔드 또는 표준 이단계 방법보다 더 나은 3D 자세 추정 성능을 낳는가?

주요 결과

  • DRPose3D는 Human3.6M 벤치마크의 세 가지 테스트 프로토콜 전반에서 최신 기술 성능을 달성하였으며, Protocol #1 기준 MPJPE는 57.8mm, Protocol #2 기준 42.9mm, Protocol #3 기준 62.8mm를 기록하였다.
  • Protocol #1과 Protocol #3 간의 MPJPE 격차를 104.7mm에서 단지 5.0mm로 감소시켜, 새로운 카메라 시야에 대한 강력한 강인성을 보여주었다.
  • 깊이 순서를 제거하면 MPJPE가 68.1mm로 증가하여, 깊이 순서가 3D 자세 추정 정확도 향상에 중대한 기여를 한다는 것을 입증하였다.
  • 노이즈가 있는 순서 예측에서 직접 회귀하는 것에 비해 코어스-투-파인 DPNet 설계로 인해 오차가 3.2mm 감소하여 노이즈 억제 효과를 입증하였다.
  • 깊이 순서에 대한 통계적 데이터 증강은 증강되지 않은 학습 대비 성능을 2.1mm 향상시켰으며, 일반화에 있어 그 가치를 확인하였다.
  • ResNet-34를 사용할 경우 Protocol #1에서 평균 정확도 91.22%를 달성하였으며, 어깨와 같은 관절 쌍은 96.71%의 정확도를 기록하여 깊이 관계 예측의 신뢰성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.