Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Multiple Hypotheses for 3D Human Pose Estimation with Mixture Density Network

Chen Li, Gim Hee Lee|arXiv (Cornell University)|2019. 04. 11.
Human Pose and Action Recognition참고 문헌 29인용 수 21
한 줄 요약

이 논문은 단일 2D 관절 입력에서 기하학적으로 타당한 3D 인간 자세 후보를 다수 생성하기 위해 혼합 밀도 네트워크(MDN)를 제안한다. 이는 단안 3D 자세 추정에서 발생하는 깊이의 모호성과 가림을 해결하기 위한 것이다. 3D 자세 분포를 가우시안 혼합 모델로 모델링함으로써, 입력 2D 관절에 정확하게 재투영되는 일관된 다수의 후보를 생성하며, Human3.6M에서 최고 성능을 기록하고 MPII 및 MPI-INF-3DHP 데이터셋에서 강력한 일반화 성능을 확보한다.

ABSTRACT

3D human pose estimation from a monocular image or 2D joints is an ill-posed problem because of depth ambiguity and occluded joints. We argue that 3D human pose estimation from a monocular input is an inverse problem where multiple feasible solutions can exist. In this paper, we propose a novel approach to generate multiple feasible hypotheses of the 3D pose from 2D joints.In contrast to existing deep learning approaches which minimize a mean square error based on an unimodal Gaussian distribution, our method is able to generate multiple feasible hypotheses of 3D pose based on a multimodal mixture density networks. Our experiments show that the 3D poses estimated by our approach from an input of 2D joints are consistent in 2D reprojections, which supports our argument that multiple solutions exist for the 2D-to-3D inverse problem. Furthermore, we show state-of-the-art performance on the Human3.6M dataset in both best hypothesis and multi-view settings, and we demonstrate the generalization capacity of our model by testing on the MPII and MPI-INF-3DHP datasets. Our code is available at the project website.

연구 동기 및 목표

  • 단안 영상 또는 2D 관절에서의 3D 자세 추정에 내재된 모호성을 해결하기 위해, 동일한 2D 관절 구성에 대해 여러 3D 자세가 투영될 수 있음을 고려한다.
  • 단일 추정 기반 접근법에서 평균 제곱 오차를 최소화하는 단일 정규 분포 가정에 기반한 기존 방법은 과적합을 일으키고 불확실성을 포착하지 못할 수 있으므로 이를 초월한다.
  • 다중 모드의 타당한 3D 자세를 모델링하기 위해 혼합 밀도 네트워크(MDN)를 사용하여 다수의 일관된 후보를 생성한다.
  • 가림된 관절 등 도전적인 자세에 대해, 불확실성 인식 자세 분포를 학습함으로써 새로운 도메인으로의 일반화 성능을 향상시킨다.
  • 기준 데이터셋에서 최고 성능을 보이며, 최고 후보 및 다중 시점 설정 모두에서 최신 기술 수준의 성능을 입증한다.

제안 방법

  • 이 방법은 이중 단계 프레임워크를 사용한다: 2D 자세 추정기가 입력 관절을 제공하고, 그 다음 혼합 밀도 네트워크(MDN) 기반의 3D 자세 후보 생성기가 이를 처리한다.
  • MDN은 M개의 가우시안 커널 혼합으로 3D 자세 분포를 모델링하며, 출력으로는 각 커널에 대한 혼합 계수, 평균, 분산을 포함한다.
  • 네트워크는 혼합 가우시안 분포의 음의 로그우도를 최소화하도록 훈련되며, 이는 단일 정규 분포 회귀보다 다중 모드 불확실성을 더 잘 포착한다.
  • 특히 드문 또는 모호한 자세에서 과적합을 방지하기 위해 혼합 계수에 딜리클레 공액 사전을 적용한다.
  • 3D 자세 후보는 M개의 가우시안 커널의 평균으로 생성되며, 이들의 2D 재투영이 입력 2D 관절과 일관성을 가지는지 평가된다.
  • 선형 레이어와 비선형 활성화 함수를 사용하여 엔드 투 엔드로 훈련되며, 훈련 중에 추가적인 2D 일관성 제약 조건은 적용되지 않는다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 동일한 2D 관절 입력에 대해 기하학적으로 타당한 다수의 3D 자세 후보를 생성할 수 있는가? 이는 3D 복원 문제의 내재된 모호성을 반영하는가?
  • RQ23D 자세 분포를 혼합 가우시안(MDN)으로 모델링하면, 평균 제곱 오차 기반 단일 정규 분포 회귀보다 성능 향상과 불확실성 추정이 향상되는가?
  • RQ3제안된 모델은 3D 훈련 레이블이 없는 데이터셋, 예를 들어 MPII 및 MPI-INF-3DHP에서 얼마나 잘 일반화되는가?
  • RQ4명시적인 2D 일관성 손실 없이도, 생성된 후보들이 2D 재투영에서 얼마나 잘 일관성을 유지하는가?
  • RQ5딜리클레 사전의 포함이 'SittingDown'이나 'GettingDown'과 같은 드문 또는 모호한 자세에서 강인성을 향상시키는가?

주요 결과

  • 제안된 MDN 기반 방법은 Human3.6M 데이터셋에서 최고 후보 및 다중 시점 설정 모두에서 최신 기술 수준의 성능을 달성하며, 이전 방법들을 능가한다.
  • 모델이 생성한 3D 자세 후보들은 2D 재투영에서 매우 높은 일관성을 보이며, PCKh@0.5 점수가 거의 1.0에 가까워, 모든 후보가 입력 2D 관절에 거의 동일하게 투영됨을 시사한다.
  • 3D 훈련 데이터를 사용하지 않은 MPII 및 MPI-INF-3DHP 데이터셋에서도 모델은 여전히 잘 일반화되며, 동일한 데이터로 훈련된 모델의 3DPCK 결과와 약간 낮지만 유사한 성능을 기록한다.
  • 제거 실험 결과, M=5개의 가우시안 커널이 성능과 계산 비용 사이의 최적의 균형을 이룹니다. M>5를 초과하면 성능 향상이 멈춘다.
  • 딜리클레 사전은 'Sitting' 및 'SittingDown'과 같은 도전적인 자세에서 성능을 크게 향상시키며, 훈련 데이터에서 우세한 'Standing' 자세에 대한 과적합을 줄인다.
  • 모델은 'GettingDown', 'SittingDown'과 같은 모호한 자세에 대해서만 서로 다른 후보를 생성하지만, 'Standing'과 같은 단순한 자세에서는 유사한 후보를 생성함으로써, 모델이 불확실성을 적절히 포착하고 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.