Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Reconstruct 3D Human Pose and Shape via Model-fitting in the Loop

Nikos Kolotouros, Pavlakos Georgios|arXiv (Cornell University)|2019. 09. 27.
Human Pose and Action Recognition인용 수 16
한 줄 요약

이 논문은 3D 인간 자세 및 형태 추정을 위한 자기 향상형 프레임워크인 SPIN을 제안한다. 깊이 있는 회귀와 반복 최적화를 통합하여, 회귀된 네트워크 출력을 기반으로 SMPL 피팅을 초기화하고, 최적화된 결과를 학습 중에 특수한 지도 정보로 활용함으로써, 제한된 3D 진짜값이 존재하는 상황에서도 기존 방법보다 뛰어난 성능을 달성한다. 이는 쌍체의 3D 진짜값이 존재하는 경우와 그렇지 않은 경우 모두에서 최신 기술 수준(SOTA)을 초월한다.

ABSTRACT

Model-based human pose estimation is currently approached through two different paradigms. Optimization-based methods fit a parametric body model to 2D observations in an iterative manner, leading to accurate image-model alignments, but are often slow and sensitive to the initialization. In contrast, regression-based methods, that use a deep network to directly estimate the model parameters from pixels, tend to provide reasonable, but not pixel accurate, results while requiring huge amounts of supervision. In this work, instead of investigating which approach is better, our key insight is that the two paradigms can form a strong collaboration. A reasonable, directly regressed estimate from the network can initialize the iterative optimization making the fitting faster and more accurate. Similarly, a pixel accurate fit from iterative optimization can act as strong supervision for the network. This is the core of our proposed approach SPIN (SMPL oPtimization IN the loop). The deep network initializes an iterative optimization routine that fits the body model to 2D joints within the training loop, and the fitted estimate is subsequently used to supervise the network. Our approach is self-improving by nature, since better network estimates can lead the optimization to better solutions, while more accurate optimization fits provide better supervision for the network. We demonstrate the effectiveness of our approach in different settings, where 3D ground truth is scarce, or not available, and we consistently outperform the state-of-the-art model-based pose estimation approaches by significant margins. The project website with videos, results, and code can be found at https://seas.upenn.edu/~nkolot/projects/spin.

연구 동기 및 목표

  • 순수한 회귀 기반 및 최적화 기반 3D 인간 자세 추정 방법의 한계를 해결하기 위해 두 기법의 장점을 융합하는 것.
  • 학습 중에 쌍체의 3D 진짜값이 필요 없도록 깊이 있는 네트워크를 3D 인간 신체 재구성에 대해 훈련할 수 있도록 하는 것.
  • 픽셀 정밀도의 모델 피팅 결과를 특수 지도 정보로 사용하여 네트워크의 일반화 능력과 정확도를 향상시키는 것.
  • 더 나은 네트워크 예측 결과가 더 나은 최적화 결과를 이끌고, 그 반대도 성립하는 자기 향상 루프를 구축하는 것.

제안 방법

  • 딥 네트워크가 이미지 픽셀에서 초기 SMPL 파라미터(자세 및 형태)를 회귀한다.
  • 회귀된 파라미터가 SMPLify와 같은 반복 최적화 절차를 초기화하여 2D 관절 검출 결과에 SMPL 모델을 피팅한다.
  • 최적화된 SMPL 파라미터를 강력하고 명시적인 3D 지도 정보로 사용하여 네트워크를 훈련시키며, 이는 더 약한 2D 재투영 손실을 대체한다.
  • 전체 과정이 훈련 루프 내에 통합되어 회귀와 최적화 간의 폐쇄 루프 협업을 형성한다.
  • 최적화 모듈을 통해 2D 관절 키포인트만으로도 3D 지도 정보를 생성함으로써, 3D 진짜값이 없는 상황에서도 훈련이 가능하다.
  • 프레임워크는 자기 향상형이다: 개선된 네트워크 예측 결과는 더 나은 최적화를 이끌고, 더 나은 최적화 결과는 네트워크 지도 정보를 향상시킨다.

실험 결과

연구 질문

  • RQ1깊이 있는 회귀와 반복 최적화 간의 밀접한 통합이 현재 최신 기술 수준을 넘어서 3D 인간 신체 재구성 성능을 향상시킬 수 있는가?
  • RQ2반복 최적화가 3D 진짜값이 부족하거나 존재하지 않는 상황에서 네트워크 훈련을 크게 향상시키는 특수 지도 정보를 제공할 수 있는가?
  • RQ3회귀와 최적화 간의 자기 향상 루프가 다양한 데이터셋과 훈련 환경에서 일관된 성능 향상을 이끌 수 있는가?
  • RQ42D 관절 키포인트 지도 정보와 최적화에 의존하여, 쌍체의 3D 애너테이션 없이도 효과적으로 3D 인간 자세 및 형태 추정을 위한 네트워크를 훈련시킬 수 있는가?

주요 결과

  • Human3.6M 데이터셋에서 SPIN은 평균 재구성 오차 41.1 mm를 기록하여 이전 최신 기술 수준인 HMR(56.8 mm)와 NBF(59.9 mm)를 크게 앞서며 성능을 뛰어넘었다.
  • 쌍체가 없는 설정(3D 진짜값이 제공되지 않음)에서도 SPIN은 62.0 mm의 재구성 오차를 기록하여 HMR(66.5 mm)와 NBF(59.9 mm)를 뛰어넘었으며, 이는 Human3.6M의 3D 데이터를 훈련에 사용하지 않았음에도 불구하고 성능이 뛰어나다.
  • MPI-INF-3DHP 데이터셋에서 SPIN은 강성 정렬 후 67.5 mm의 MPJPE를 기록하여 HMR(89.8 mm)와 VNect(98.0 mm)를 능가했으며, 쌍체가 없는 설정에서 Mehta 등(117.6 mm)을 뛰어넘었다.
  • MPI-INF-3DHP에서 SPIN은 강성 정렬 후 92.5%의 PCK와 55.6%의 AUC를 기록하여 HMR(86.3%와 47.8%)와 VNect(83.9%와 47.3%)를 모두 능가했다.
  • 오염, 복잡한 자세, 다수의 인물이 있는 장면과 같은 도전적인 케이스에 대해 뛰어난 강건성을 보였지만, 드문 시점이나 모호한 깊이 상황에서는 실패 케이스가 관찰되었다.
  • 자기 향상 루프 덕분에 일관된 성능 향상이 가능했다: 더 나은 네트워크 예측 결과는 최적화 수렴을 향상시키고, 더 나은 최적화 결과는 네트워크 지도 정보를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.