Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Textured 3D Reconstruction of Human Bodies

Abbhinav Venkat, Sai Sagar Jinka|arXiv (Cornell University)|2018. 09. 18.
Advanced Vision and Imaging인용 수 10
한 줄 요약

이 논문은 RGB와 깊이(RGB/D) 입력을 사용하여 단일 이미지에서 질감 있는 인간 신체의 3D 재구성을 위한 딥러닝 프레임워크를 제안한다. 이는 체적 형태 예측과 정사영 질감 합성에 기반한다. 다중 시점 RGB/D 데이터로부터 깊이와 형태를 동시에 학습함으로써, 시뮬레이션 및 실제 데이터 모두에서 뛰어난 재구성 품질을 달성하며, 복잡한 자세와 혼잡한 배경에서 RGB-only 기준선보다 뛰어난 성능을 보인다.

ABSTRACT

Recovering textured 3D models of non-rigid human body shapes is challenging due to self-occlusions caused by complex body poses and shapes, clothing obstructions, lack of surface texture, background clutter, sparse set of cameras with non-overlapping fields of view, etc. Further, a calibration-free environment adds additional complexity to both - reconstruction and texture recovery. In this paper, we propose a deep learning based solution for textured 3D reconstruction of human body shapes from a single view RGB image. This is achieved by first recovering the volumetric grid of the non-rigid human body given a single view RGB image followed by orthographic texture view synthesis using the respective depth projection of the reconstructed (volumetric) shape and input RGB image. We propose to co-learn the depth information readily available with affordable RGBD sensors (e.g., Kinect) while showing multiple views of the same object during the training phase. We show superior reconstruction performance in terms of quantitative and qualitative results, on both, publicly available datasets (by simulating the depth channel with virtual Kinect) as well as real RGBD data collected with our calibrated multi Kinect setup.

연구 동기 및 목표

  • 복잡한 자세, 옷에 의한 가림, 배경 혼잡성 등의 실제 조건에서 단일 RGB 이미지로부터 세밀하고 질감 있는 3D 인간 신체 모델을 재구성하는 문제를 해결하기 위해.
  • 교정된 다중 카메라 설정이나 강력한 신체 모델 사전 지식에 의존하는 기존 방법의 한계를 극복하기 위해, 교정이 필요 없고 단일 시점에서의 재구성을 가능하게 하기 위해.
  • 저가의 센서(예: Kinect)에서 확보한 다중 시점 RGB/D 데이터를 활용해 훈련 중 깊이와 형태 표현을 동시에 학습시킴으로써 재구성 정확도를 향상시키기 위해.
  • 예측된 체적 형태와 입력 RGB 이미지를 기반으로 정사영 질감 시각화를 합성하여 단일 이미지에서 고품질의 질감 복원을 가능하게 하기 위해.
  • 모의 및 실제 RGBD 데이터를 사용하여, 극단적인 자세와 복잡한 배경을 포함한 다양한 데이터셋에서의 강건성을 입증하기 위해.

제안 방법

  • 이 방법은 다중 시점 RGB/D 데이터로 훈련된 딥 네트워크를 사용하여 단일 RGB 이미지에서 비강성 인간 신체의 체적 격자 표현을 예측한다.
  • 훈련 중 RGB/D 센서에서의 깊이 정보를 활용하여 깊이와 형태 표현을 동시에 학습함으로써 네트워크의 정규화를 도모하고 일반화 능력을 향상시킨다.
  • 정사영 질감 시각화는 재구성된 3D 체적 형태를 깊이 공간에 투영하고, 해당 RGB 이미지를 사용하여 2D 정사영 질감 맵을 생성함으로써 수행된다.
  • 변동형 오토인코더를 사용하여 합성된 정사영 시각화에서 저해상도(64×64) 질감 이미지를 생성하고, 이를 다시 3D 메쉬에 투영하여 질감이 있는 모델을 생성한다.
  • 훈련 철학은 교정된 다중 Kinect 설정에서의 다중 시점 데이터를 사용하며, 일부 경우에서는 가상 Kinect를 통해 깊이를 시뮬레이션하여 단일 시점 추론에 대한 강건한 일반화를 가능하게 한다.
  • 자신의 신체 대칭성을 활용함으로써 명시적인 신체 모델 제약 없이도 재구성의 강건성을 향상시키며, 자유형 옷에 의한 비강성 변형을 부분적으로 처리할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1딥러닝 모델이 교정된 다중 카메라 시스템이 없이도 단일 RGB 이미지에서 비강성 인간 신체의 정확한 3D 재구성을 달성할 수 있는가?
  • RQ2훈련 중 깊이 정보를 통합함으로써 단일 이미지 3D 재구성 성능가 향상되는 정도는 어떻게 되며, 특히 자기 가림과 복잡한 자세 상황에서 어떤 영향을 미치는가?
  • RQ3단일 RGB 이미지만을 이용할 때, 단일 시점 질감 합성 파이프라인의 성능이 얼마나 현실적으로 질감을 생성할 수 있는가?
  • RQ4깊이와 형태 표현의 동시 학습이 다양한 자세와 배경 조건에서 모델의 강건성을 어떻게 향상시키는가?
  • RQ5교정된 다중 Kinect 설정에서 수집된 실제 세계 데이터에 대해 이 방법이 일반화되어 고품질의 재구성 품질을 유지할 수 있는가?

주요 결과

  • 제안된 방법은 다양한 데이터셋에서 교차 면적율(IoU) 측면에서 뛰어난 정량적 성능을 달성하였으며, 특히 복잡한 자세와 혼잡한 배경에서 RGB-only 기준선보다 뚜렷한 향상을 보였다.
  • MIT의 핸드스탠드 시퀀스 및 복잡한 배경 등 도전적인 상황에서 RGB와 RGB/D 입력 간의 IoU 차이가 더욱 커지며, 정확한 재구성에 있어 깊이 정보의 핵심적 역할을 입증한다.
  • 정성적 결과는 인간 신체의 대칭성을 활용할 수 있는 네트워크의 능력 덕분에 다양한 인간 동작, 특히 극단적인 자세에서도 강건한 재구성을 보여준다.
  • 명시적인 신체 모델 제약 없이도 자유형 옷에 의한 비강성 변형을 성공적으로 처리하였으며, 산바 무용 시퀀스 결과를 통해 이를 입증하였다.
  • 질감 합성은 현실적인 저해상도(64×64) 정사영 질감을 효과적으로 생성하며, 이를 3D 메쉬에 투영하여 결과를 도출하였다. 결과는 보조 영상에서 시각화되어 있다.
  • 이 프레임워크는 교정된 다중 Kinect 설정에서 수집된 실제 세계 RGBD 데이터에 대해 강력한 일반화 능력을 보이며, 시뮬레이션을 넘어서 실제 적용 가능성도 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.