Skip to main content
QUICK REVIEW

[논문 리뷰] SMPLR: Deep SMPL reverse for 3D human pose and shape recovery

Meysam Madadi, Hugo Bertiche|arXiv (Cornell University)|2018. 12. 27.
Human Pose and Action Recognition참고 문헌 38인용 수 19
한 줄 요약

이 논문은 SMPLR를 제안하며, 3D 관절 예측을 중간 표현으로 사용하여 단일 RGB 이미지에서 3D 인간 자세와 형태를 복원하는 딥러닝 프레임워크이다. SMPLR를 CNN 기반 인코더와 SMPL을 디코더로 갖는 오토에인코더로 설정함으로써 복잡한 정규화를 피하고 최신 기술 수준의 성능을 달성하며, 기존의 SMPL 기반 방법에 비해 Human3.6M에서 3D 관절 오차를 25mm 감소시키고 SURREAL에서 3.5mm 감소시킨다.

ABSTRACT

Current state-of-the-art in 3D human pose and shape recovery relies on deep neural networks and statistical morphable body models, such as the Skinned Multi-Person Linear model (SMPL). However, regardless of the advantages of having both body pose and shape, SMPL-based solutions have shown difficulties to predict 3D bodies accurately. This is mainly due to the unconstrained nature of SMPL, which may generate unrealistic body meshes. Because of this, regression of SMPL parameters is a difficult task, often addressed with complex regularization terms. In this paper we propose to embed SMPL within a deep model to accurately estimate 3D pose and shape from a still RGB image. We use CNN-based 3D joint predictions as an intermediate representation to regress SMPL pose and shape parameters. Later, 3D joints are reconstructed again in the SMPL output. This module can be seen as an autoencoder where the encoder is a deep neural network and the decoder is SMPL model. We refer to this as SMPL reverse (SMPLR). By implementing SMPLR as an encoder-decoder we avoid the need of complex constraints on pose and shape. Furthermore, given that in-the-wild datasets usually lack accurate 3D annotations, it is desirable to lift 2D joints to 3D without pairing 3D annotations with RGB images. Therefore, we also propose a denoising autoencoder (DAE) module between CNN and SMPLR, able to lift 2D joints to 3D and partially recover from structured error. We evaluate our method on SURREAL and Human3.6M datasets, showing improvement over SMPL-based state-of-the-art alternatives by about 4 and 25 millimeters, respectively.

연구 동기 및 목표

  • 단일 RGB 이미지에서 정확한 3D 인간 자세와 형태 복원 문제를 해결하기 위해, 특히 SMPL 기반 방법이 모델의 다대일 매핑과 노이즈에 민감하여 비현실적인 신체 메시를 생성하는 문제를 해결하기 위함.
  • SMPL 매개변수 회귀에 복잡한 정규화 항목이 필요 없도록 하기 위해 3D 관절 예측을 중간에 분리된 표현으로 사용하기 위함.
  • 실외 환경에서의 가림과 깊이 모호성 등으로 인한 구조적 오류가 있는 2D에서 3D 관절 러핑에 대한 강건성을 향상시키기 위함.
  • SMPL 관련 오차가 CNN를 통해 역전파될 수 있도록 엔드 투 엔드 학습을 가능하게 하여 관절 추정과 메시 재구성 향상시키기 위함.
  • 실제 3D 앵커파라미터가 학습 데이터에 포함되지 않은 채로도 합성 모션 캡처 유사 데이터에서 독립적으로 SMPLR를 훈련시켜 교차 데이터셋 일반화를 가능하게 하기 위함.

제안 방법

  • 방법론은 RGB 이미지에서 3D 관절 위치와 희소 3D 랜드마크를 중간 표현으로 사용하여 예측하기 위해 볼륨형 스택드 아워글래스 네트워크(SHN)를 사용한다.
  • SHN과 SMPLR 사이에 노이즈 제거 오토에인코더(DAE)를 도입하여 대칭성, 뼈 길이 비율, 인간 친화적인 기하학적 구조를 강제함으로써 2D 또는 노이즈가 있는 3D 관절 예측을 정제한다.
  • DAE의 출력은 예측된 정제된 3D 관절 및 랜드마크 데이터로부터 SMPL 자세 및 형태 매개변수를 추정하기 위해 이중 분지형 다층 퍼셉트론(MLP) 네트워크에 입력된다.
  • SMPL 모델은 예측된 SMPL 매개변수로부터 전체 3D 신체 메시를 생성하기 위한 미분 가능한 디코더로 기능하며, 엔드 투 엔드 학습을 가능하게 한다.
  • SHN + DAE + MLP + SMPL 전체 파이프라인은 엔드 투 엔드로 훈련되어 메시 및 관절 오차가 네트워크 전반에 걸쳐 역전파되도록 한다.
  • 프레임워크는 SMPLR를 합성 모션 캡처 데이터에서 훈련함으로써, 실제 데이터셋인 SURREAL과 Human3.6M로의 일반화를 가능하게 하며, 학습 데이터에 진짜 SMPL 매개변수가 포함되지 않아도 된다.

실험 결과

연구 질문

  • RQ1SMPL 모델을 뒤집는 딥 오토에인코더 유사 구조가 단일 RGB 이미지에서 3D 인간 신체 재구성 성능을 향상시킬 수 있는가?
  • RQ2직접 SMPL 매개변수 회귀 대비 3D 관절 예측을 중간 표현으로 사용할 경우 비현실적인 메시 생성 위험이 감소하는가?
  • RQ3노이즈 제거 오토에인코더가 특히 가림이나 깊이 모호성 상황에서 2D에서 3D 관절 러핑의 구조적 오류를 효과적으로 복구할 수 있는가?
  • RQ4합성 모션 캡처 데이터에서 훈련하고 실제 이미지에서 미세조정한 경우, SMPLR가 데이터셋 간에 얼마나 잘 일반화되는가?
  • RQ5미분 가능한 SMPL 렲팅을 통한 엔드 투 엔드 학습이 비미분 또는 약한 지도 학습 대비 3D 관절 및 메시 정확도를 향상시키는가?

주요 결과

  • Human3.6M 데이터셋에서 SMPLR는 프로토콜 1 하에서 기존 최신 기술 수준의 SMPL 기반 방법에 비해 3D 관절 오차를 25mm 감소시켜 정확도 향상을 뚜렷이 보였다.
  • SURREAL 데이터셋에서 SMPLR는 다중 작업 학습 없이도 기존 최신 기술 수준에 비해 SMPL 표면 오차를 3.5mm 감소시켰다.
  • DAE 모듈은 2D에서 3D 관절 러핑의 구조적 오류를 효과적으로 제거하여 뼈 길이 일관성과 예측된 자세의 대칭성을 향상시켰다.
  • 모든 평가된 데이터셋에서 실루엣 IoU가 0.7 초과를 기록하였으며, 이는 명시적인 훈련 없이도 고품질의 메시 렌더링을 가능하게 함을 시사한다.
  • 최종 엔드 투 엔드 훈련 모델 ({SHN}_{e2e}^{final})는 SURREAL에서 40.8mm의 최신 기술 수준의 3D 관절 추정 오차를 달성하였으며, 다중 작업 학습 없이도 최고 성능을 내는 방법과 동일한 성능을 보였다.
  • GTX 1080Ti에서 추론 속도가 3 FPS이며, 진짜 이미지 크롭핑 대신 추정된 크롭핑을 사용할 경우 성능 저하가 최소로 발생하여 실제 전처리 오류에 강건함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.