Skip to main content
QUICK REVIEW

[논문 리뷰] Single Image 3D Hand Reconstruction with Mesh Convolutions

Dominik Kulon, Haoyang Wang|arXiv (Cornell University)|2019. 05. 04.
Human Pose and Action Recognition참고 문헌 41인용 수 16
한 줄 요약

이 논문은 메시 컨볼루션과 스펙트럴 오토에인코더를 사용하여 비선형적이고 경량화된 그래프 모어포픽 모델을 학습하는 실시간 단일 이미지 3D 손 재구성 시스템을 제안한다. 고해상도 손 메시에 대해 스펙트럴 디코더를 훈련시키고, 이를 이미지 인코더와 카메라 회귀기와 결합함으로써, 파arameter 수가 6배 적고 실시간 추론(53 FPS)을 구현하면서도 최신 기술 수준의 재구성 정확도를 달성한다.

ABSTRACT

Monocular 3D reconstruction of deformable objects, such as human body parts, has been typically approached by predicting parameters of heavyweight linear models. In this paper, we demonstrate an alternative solution that is based on the idea of encoding images into a latent non-linear representation of meshes. The prior on 3D hand shapes is learned by training an autoencoder with intrinsic graph convolutions performed in the spectral domain. The pre-trained decoder acts as a non-linear statistical deformable model. The latent parameters that reconstruct the shape and articulated pose of hands in the image are predicted using an image encoder. We show that our system reconstructs plausible meshes and operates in real-time. We evaluate the quality of the mesh reconstructions produced by the decoder on a new dataset and show latent space interpolation results. Our code, data, and models will be made publicly available.

연구 동기 및 목표

  • 선형 통계 모델(예: SMPL 및 MANO)이 비선형 손 변형과 연조직 효과를 포괄하지 못하는 한계를 해결하기 위해.
  • 고해상도 손 메시에 대해 훈련된 비지도 스펙트럴 오토에인코더를 활용해 경량화된 비선형 3D 손 형태 사전을 개발하기 위해.
  • 사전 훈련된 스펙트럴 디코더를 이미지 인코더와 카메라 회귀기와 결합하여 단일 RGB 이미지에서 실시간 3D 손 메시 재구성 기능을 제공하기 위해.
  • 훈련 및 평가를 위해 실제 자세와 형태 변화를 반영한 고해상도, 고정밀도의 3D 손 메시 데이터셋을 새롭게 생성하기 위해.
  • 학습된 그래프 기반 모어포픽 모델이 전통적인 선형 모델보다 재구성 품질과 효율성 측면에서 뛰어나다는 것을 입증하기 위해.

제안 방법

  • 정규화된 척도와 글로벌 방향을 갖춘 대규모 3D 손 메시 세트에 대해 스펙트럴 오토에인코더를 훈련시켜 손 형태의 비선형 잠재 공간 표현을 학습하기 위해.
  • 그래프 라플라시안을 통한 스펙트럴 도메인에서의 그래프 컨volution 네트워크를 사용하여 메시 상에서 내재된 컨볼루션을 수행함으로써, 회전 불변 특징 학습을 가능하게 하기 위해.
  • 사전 훈련된 스펙트럴 디코더를 비선형 통계적 변형 가능 모델로 고정하고, 이를 이미지 인코더와 연결하여 단일 이미지에서 잠재 형태 및 자세 파라미터를 예측하기 위해.
  • 생성된 메시가 입력 이미지와 정렬되도록 별도의 약한 투영 카메라 회귀기를 훈련시키되, 메시 생성기로의 기울기 유입을 차단하여 재구성 품질을 유지하기 위해.
  • 1,000개의 스캔과 Panoptic Studio 3D 애너테이션에 기반하여 고버텍스 수의 손 모델을 피팅하고, 오일러 각도의 K-평균 클러스터링을 통한 자세 샘플링을 통해 훈련 데이터를 합성하기 위해.
  • 디코더의 잠재 공간을 활용하여 매끄러운 보간과 형태/자세의 분리된 표현을 실현함으로써, 신뢰할 수 있는 메시 생성 및 시각화를 가능하게 하기 위해.

실험 결과

연구 질문

  • RQ1손 메시에 대한 스펙트럴 오토에인코더가 MANO나 SMPL과 같은 선형 모델보다 더 표현력 있고 비선형적인 형태 사전을 학습할 수 있는가?
  • RQ2학습된 그래프 모어포픽 모델이 기준선 선형 모델보다 단일 이미지에서 더 높은 품질의 3D 손 재구성 성능을 제공하는가?
  • RQ3고정밀도 재구성 정확도와 다양한 자세 및 형태에 대한 일반화 능력을 유지하면서도 실시간 추론을 달성할 수 있는가?
  • RQ4스펙트럴 컨볼루션과 공간 컨볼루션 간의 비교에서, 메시의 미세한 변형을 모델링하는 데서나 파rameter 효율성 측면에서 어떤 차이가 있는가?
  • RQ5오토에인코더의 잠재 공간이 형태와 자세 요인의 의미 있는 보간과 분리 표현을 얼마나 잘 지원하는가?

주요 결과

  • 제안된 스펙트럴 오토에인코더는 Panoptic DomeDb 데이터셋에서 메시 L1 재구성 오차 2.33 mm를 달성하여, 기준선 MANO 유사 모델(2.56 mm)보다 우수한 성능을 보였으며, 후자는 지표 데이터를 생성하는 데 사용된 바 있다.
  • 스펙트럴 기반 생성기는 파라미터 수가 393,080개에 불과하며, 이는 250만 파라미터의 MANO 유사 기준선 대비 6배 적고, 329 FPS로 더 빠른 추론 성능을 보였다.
  • 전체 시스템은 DenseNet-121 이미지 인코더를 사용하여 53 FPS로 실행되어 단일 이미지에서 실시간 3D 손 재구성 기능을 제공한다.
  • 잠재 공간 보간은 손가락 길이 및 관절 각도의 변화를 포함한 다양한 손 형태와 자세 간에 매끄럽고 시각적으로 타당한 전이를 생성한다.
  • 스펙트럴 디코더의 파인튜닝을 통해 재구성 오차가 2.30 mm로 추가로 감소하여, 모델 크기를 증가시키지 않고도 엔드 투 엔드 훈련이 성능 향상에 기여한다는 것을 시사한다.
  • 시험 세트의 어려운 샘플에 대한 정성적 결과를 통해, 시스템이 도전적인 자세와 형태에 잘 일반화됨을 확인할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.