Skip to main content
QUICK REVIEW

[논문 리뷰] TetraTSDF: 3D human reconstruction from a single image with a tetrahedral outer shell

Hayato Onizuka, Zehra Hayirci|arXiv (Cornell University)|2020. 04. 22.
3D Shape Modeling and Analysis참고 문헌 43인용 수 5
한 줄 요약

이 논문은 단일 RGB 이미지에서 고해상도 3D 재구성을 가능하게 하는 컴act하고 조밀한 3D 인간 신체 표현인 TetraTSDF를 제안한다. 이는 인간 전용 외곽 셸 내에 임bed된 사다리형 절삭된 부호거리 함수(TSDF)를 사용한다. 이 방법은 CNN 기반의 새로운 파트 연결 네트워크(PCN)를 활용하여 엔드 투 엔드 회귀를 수행하며, 느슨한 옷, 손가락, 신발과 같은 미세한 디테일을 재구성하는 데 최첨단 정확도를 달성한다. 정량적·정성적 평가에서 기존 방법을 능가하며, 평균 카프먼 거리는 약 0.5 cm를 기록한다.

ABSTRACT

Recovering the 3D shape of a person from its 2D appearance is ill-posed due to ambiguities. Nevertheless, with the help of convolutional neural networks (CNN) and prior knowledge on the 3D human body, it is possible to overcome such ambiguities to recover detailed 3D shapes of human bodies from single images. Current solutions, however, fail to reconstruct all the details of a person wearing loose clothes. This is because of either (a) huge memory requirement that cannot be maintained even on modern GPUs or (b) the compact 3D representation that cannot encode all the details. In this paper, we propose the tetrahedral outer shell volumetric truncated signed distance function (TetraTSDF) model for the human body, and its corresponding part connection network (PCN) for 3D human body shape regression. Our proposed model is compact, dense, accurate, and yet well suited for CNN-based regression task. Our proposed PCN allows us to learn the distribution of the TSDF in the tetrahedral volume from a single image in an end-to-end manner. Results show that our proposed method allows to reconstruct detailed shapes of humans wearing loose clothes from single RGB images.

연구 동기 및 목표

  • 느슨한 옷을 입은 경우에도 단일 RGB 이미지에서 세밀한 3D 인간 신체 형태를 재구성하는 데 도전하는 것.
  • CNN 기반 회귀에서 기존 볼륨형 TSDF 표현의 메모리 및 해상도 제약을 극복하는 것.
  • 딥러닝에 적합하면서도 컴팩트하고 조밀하며 정확한 3D 표현을 개발하여 고해상도 디테일 복원을 지원하는 것.
  • CNN과 파트 연결 네트워크(PCN)를 조합한 새로운 아키텍처를 통해 단일 이미지에서 3D 형태를 엔드 투 엔드로 학습하는 것.
  • 손, 발, 옷 주름과 같은 비凸 및 가림 영역에서의 재구성 정확도를 향상시키는 것.

제안 방법

  • 粗모델인 SMPL 모델에서 유도된 사다리형 외곽 셸을 제안하여 TSDF 필드의 기하학적 기초를 제공한다.
  • 외곽 셸의 정점에 사다리형 볼륨 메시를 구축하여 절삭된 부호거리 함수(TSDF) 필드를 임베딩함으로써 조밀하고 컴팩트한 3D 표현을 가능하게 한다.
  • 사다리형 정점 간 국소 기하학적 관계를 모델링하여 특징 학습을 향상시키고 회귀 정확도를 향상시키는 파트 연결 네트워크(PCN)를 도입한다.
  • 단일 RGB 이미지에서 TSDF 필드를 직접 회귀하는 엔드 투 엔드 CNN-PCN 아워가스 네트워크를 설계한다.
  • 학습을 위해 진짜 3D 스캔 데이터를 사용하여 고품질의 TSDF 필드를 생성함으로써 정확한 감독을 보장한다.
  • 학습 중 외곽 셸과 TSDF 필드를 정교화하기 위해 유연한 렌더링 및 최적화 파이프라인을 활용한다.

실험 결과

연구 질문

  • RQ1사다리형 기반의 TSDF 표현은 메모리 효율성을 유지하면서도 단일 RGB 이미지에서 고해상도 3D 인간 신체 재구성을 달성할 수 있는가?
  • RQ2PCN 기반 아키텍처는 사다리형 격자에서 국소 기하학적 의존성을 효과적으로 모델링하여 CNN 특징에서 3D 형태 회귀를 향상시킬 수 있는가?
  • RQ3제안된 방법은 손가락, 신발, 옷 주름과 같은 세밀한 디테일을 재구성하는 데 기존 최첨단 기술을 능가하는가?
  • RQ4손, 발과 같은 가림 영역이나 비凸 영역을 어떻게 처리하는가? 특히 느슨한 옷을 입은 경우에 대해 어떻게 작동하는가?
  • RQ5이산화물 맵핑이나 표준 볼륨 격자에 비해 컴팩트한 사다리형 표현이 형태 디테일을 얼마나 잘 유지하는가?

주요 결과

  • 제안된 방법은 아티큘레이티드 데이터셋에서 평균 카프먼 거리 약 0.5 cm를 기록하여 기존 방법인 BodyNet과 Tex2Shape를 능가했다.
  • 정성적 결과에서 손가락의 정확한 자세 재현과 발 주변의 신발 재현이 가능했으며, 손 자세가 알려지지 않은 경우에도 우수한 성능을 보였다.
  • 이 방법은 종종 이산화물 맵핑이나 저해상도 볼륨 격자 표현에서 손실되는 가림 영역과 복잡한 옷 주름까지 성공적으로 복원했다.
  • PCN 기반 네트워크는 수렴성과 정확도가 향상되었으며, 연결 수에 민감한 성능을 보이며 메모리와 정밀도 사이의 상충 관계를 보여주었다.
  • 사다리형 TSDF 표현은 이전 방법보다 더 높은 해상도의 재구성을 가능하게 하였고, 메모리 효율성도 유지하여 GPU 메모리 오버플로우 문제를 피했다.
  • 제거 분석 결과, PCN는 기본 아키텍처에 비해 특징 학습과 형태 디테일 복원 능력을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.