Skip to main content
QUICK REVIEW

[논문 리뷰] HEMlets PoSh: Learning Part-Centric Heatmap Triplets for 3D Human Pose and Shape Estimation

Kun Zhou, Xiaoguang Han|arXiv (Cornell University)|2020. 03. 10.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 단일 RGB 이미지에서 3D 인간 자세 및 형태 추정을 위한 새로운 방법인 HEMlets PoSh를 제안한다. Part-Centric Heatmap Triplets(HEMlets)를 중간 표현으로 사용하여 관절 쌍 간의 상대적 깊이 순서와 공간적 위치 일치 가능성도 인코딩한다. 이는 점진적 학습 전략을 가능하게 하여 Human3.6M에서 최신 기술 대비 약 20% 향상된 3D 자세 추정 정확도를 달성하며, 실외 이미지에 대해서도 잘 일반화된다.

ABSTRACT

Estimating 3D human pose from a single image is a challenging task. This work attempts to address the uncertainty of lifting the detected 2D joints to the 3D space by introducing an intermediate state-Part-Centric Heatmap Triplets (HEMlets), which shortens the gap between the 2D observation and the 3D interpretation. The HEMlets utilize three joint-heatmaps to represent the relative depth information of the end-joints for each skeletal body part. In our approach, a Convolutional Network (ConvNet) is first trained to predict HEMlets from the input image, followed by a volumetric joint-heatmap regression. We leverage on the integral operation to extract the joint locations from the volumetric heatmaps, guaranteeing end-to-end learning. Despite the simplicity of the network design, the quantitative comparisons show a significant performance improvement over the best-of-grade methods (e.g. $20\%$ on Human3.6M). The proposed method naturally supports training with "in-the-wild" images, where only weakly-annotated relative depth information of skeletal joints is available. This further improves the generalization ability of our model, as validated by qualitative comparisons on outdoor images. Leveraging the strength of the HEMlets pose estimation, we further design and append a shallow yet effective network module to regress the SMPL parameters of the body pose and shape. We term the entire HEMlets-based human pose and shape recovery pipeline HEMlets PoSh. Extensive quantitative and qualitative experiments on the existing human body recovery benchmarks justify the state-of-the-art results obtained with our HEMlets PoSh approach.

연구 동기 및 목표

  • 2D 관절을 3D 공간으로 올리는 데 발생하는 모호성과 큰 도메인 갭 문제를 해결하기 위해, 학습 가능한 중간 표현을 도입한다.
  • 약한 감독을 받는 상대적 깊이 순서 정보를 활용하여, 제약 없는 실외 이미지에 대한 일반화 능력을 향상시킨다.
  • 체적 히트맵 상에서 소프트-아르그맥스를 통해 엔드 투 엔드로 미분 가능한 3D 관절 회귀를 가능하게 한다.
  • 단일 이미지에서 3D 자세 및 SMPL 신체 형태 회귀를 위한 단순하면서도 효과적인 파ipeline을 개발한다.
  • Human3.6M, 3DPW, SURREAL, UP-3D와 같은 표준 벤치마크에서 최신 기술 수준의 성능을 입증한다.

제안 방법

  • 이 방법은 각 뼈대 부위의 끝 관절에 대해 세 가지 상대적 깊이 상태(앞쪽, 뒤쪽, 동일 깊이)를 표현하기 위해 세 개의 2D 히트맵을 사용하는 Part-Centric Heatmap Triplets(HEMlets)를 도입한다.
  • 두 단계의 컨볼루션 네트워크는 입력 RGB 이미지에서 먼저 2D 관절 히트맵과 HEMlets를 예측한 후, 고수준 특징과 HEMlets를 보조 감독으로 사용하여 3D 체적 히트맵을 회귀한다.
  • 3D 관절 위치는 미분 가능한 소프트-아르그맥스 연산을 통해 추출되어 기울기 역전파를 통한 엔드 투 엔드 학습이 가능하다.
  • 같은 특징 공간에서 SMPL 신체 형태(β)와 자세(θ) 파rameter를 회귀하기 위해 얕고 가벼운 네트워크 헤드를 추가한다.
  • 해당 프레임워크는 상대적 깊이 순서 정보만 있는 데이터셋을 사용해 약한 감독 기반 사전 훈련이 가능하여, 실제 환경 이미지에 대한 강인성을 향상시킨다.
  • 모델은 점진적으로 훈련된다: 먼저 2D 관절 검출 및 HEMlets 예측을 수행한 후, 3D 히트맵 회귀를 수행함으로써 과적합을 줄이고 수렴성을 향상시킨다.

실험 결과

연구 질문

  • RQ1상대적 깊이 순서를 인코딩하는 파트 중심 중간 표현이 단일 이미지에서 3D 인간 자세 추정 성능을 향상시킬 수 있는가?
  • RQ22D 관측치와 3D 예측치 사이를 연결하는 HEMlets를 학습함으로써 도메인 갭이 줄어들고 실외 이미지에 대한 일반화 능력이 향상되는가?
  • RQ33D 자세 추정 정확도가 후속 SMPL 신체 형태 및 자세 회귀 품질에 얼마나 큰 영향을 미치는가?
  • RQ4진행적 감독을 갖춘 단순하고 모듈화된 네트워크 설계가 3D 인간 신체 복원에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5약한 레이블링된 상대 깊이 정보만으로 훈련된 경우, 제안된 방법의 효과는 어느 정도인가?

주요 결과

  • HEMlets PoSh는 Human3.6M 벤치마크에서 평균 관절 위치 오차(MPJPE) 39.9mm를 기록하여, 최고의 경쟁 방법 [42] 대비 약 20% 향상된 성능을 달성한다.
  • 어려운 조명 조건과 가림 현상이 있는 실외 환경에서의 질적 결과를 통해, 이 방법은 실외 이미지에 대해 잘 일반화됨을 입증한다.
  • 3DPW 데이터셋에서 전체 HEMlets PoSh 모델은 재구성 오차 58.8mm를 기록하여, 아블레이션된 버전들과 이전 방법들을 모두 능가한다.
  • 아블레이션 연구 결과, 3D 관절 회귀 브랜치가 고수준 특징 브랜치만 있는 경우보다 몰드 메시 복원에 더 크게 기여하는 것으로 나타났다.
  • 예측된 자세를 진짜 자세로 교체하면 오차가 9.4mm로 감소하여, 자세 정확도가 신체 형태 복원 품질의 주요 결정 요소임을 시사한다.
  • SURREAL 및 UP-3D 데이터셋에서 모두 가장 낮은 표면 오차를 기록하여, 다양한 벤치마크에서 최신 기술 수준의 성능을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.