Skip to main content
QUICK REVIEW

[논문 리뷰] MonoClothCap: Towards Temporally Coherent Clothing Capture from Monocular RGB Video

Donglai Xiang, Fabián Prada|arXiv (Cornell University)|2020. 09. 22.
3D Shape Modeling and Analysis참고 문헌 63인용 수 4
한 줄 요약

이 논문은 사전 스캔된 템플릿이 필요 없이 단일 RGB 영상에서 시간적으로 일관된 3D 옷 입는 포즈를 캡처하는 MonoClothCap를 제안한다. T셔츠, 반바지, 바지에 대해 통계적 변형 모델을 사용하고, 다양한 렌더링 손실을 최소화하기 위해 미분 가능 렌더러를 활용하여 실루엣, 세그멘테이션, 텍스처, 노멀 맵을 기반으로 옷의 형태를 피팅함으로써, 실제 영상에서의 세밀한 주름까지 고해상도이고 시간적으로 안정된 재구성을 달성한다.

ABSTRACT

We present a method to capture temporally coherent dynamic clothing deformation from a monocular RGB video input. In contrast to the existing literature, our method does not require a pre-scanned personalized mesh template, and thus can be applied to in-the-wild videos. To constrain the output to a valid deformation space, we build statistical deformation models for three types of clothing: T-shirt, short pants and long pants. A differentiable renderer is utilized to align our captured shapes to the input frames by minimizing the difference in both silhouette, segmentation, and texture. We develop a UV texture growing method which expands the visible texture region of the clothing sequentially in order to minimize drift in deformation tracking. We also extract fine-grained wrinkle detail from the input videos by fitting the clothed surface to the normal maps estimated by a convolutional neural network. Our method produces temporally coherent reconstruction of body and clothing from monocular video. We demonstrate successful clothing capture results from a variety of challenging videos. Extensive quantitative experiments demonstrate the effectiveness of our method on metrics including body pose error and surface reconstruction error of the clothing.

연구 동기 및 목표

  • 사전 스캔된 개인 맞춤 메쉬 템플릿에 의존하지 않고 단일 RGB 영상에서 시간적으로 일관된 동적 옷의 변형을 캡처하는 문제를 해결하기 위해.
  • 다중 시점 스캔이 가능한 통제된 환경이 아닌 실제 영상에서의 옷 캡처를 가능하게 하기 위해.
  • 다양한 이미지 측정값(실루엣, 세그멘테이션, 텍스처, 노멀)을 미분 가능 렌더링을 통해 통합함으로써 기하학적 정확성과 시각적 사실성 향상 및 시간적 일관성 향상을 위해.
  • T셔츠, 반바지, 바지와 같은 일반적인 의류 유형에 특화된 통계적 형태 사전을 사용하여 재구성의 안정성을 향상시키기 위해.
  • 딥러닝을 통해 추정한 노멀 맵에 기반해 옷을 둘러싼 표면을 피팅하여 세밀한 주름 세부 정보를 추출하기 위해.

제안 방법

  • 세 가지 의류 유형(T셔츠, 반바지, 바지)에 대해 실제 의류 데이터 기반으로 훈련된 통계적 변형 모델을 구축하여 형태 사전으로 활용한다.
  • 실루엣, 세분화, 텍스처, 표면 노멀 맵을 감독으로 사용하여 렌더링된 이미지와 입력 프레임 간의 광학적 및 기하학적 손실을 최소화하기 위해 미분 가능 렌더러를 적용한다.
  • 시간에 따라 변형 추적 오차를 줄이기 위해 시각적 텍스처 영역을 순차적으로 확장하는 UV 텍스처 성장 전략을 도입한다.
  • 합성곱 신경망이 예측한 노멀 맵에 기반해 옷을 둘러싼 표면을 피팅하여 세밀한 주름 세부 정보를 캡처한다.
  • 다양한 이미지 신호(2D 관절, 조밀한 대응, 실루엣)를 사용해 신체 자세를 초기화한 후, 시간적 일관성을 확보하기 위해 순차적 추적 및 배치 최적화를 수행한다.
  • 미분 가능 렌더링 손실을 통한 엔드 투 엔드 최적화를 통합하여 신체 자세, 의류 형태, 텍스처를 동시에 개선한다.

실험 결과

연구 질문

  • RQ1사전 스캔된 템플릿이 없는 단일 영상에서 시간적으로 일관된 3D 옷 재구성을 달성할 수 있는가?
  • RQ2통계적 의류 변형 모델이 단일 시점 3D 옷 캡처에서 재구성의 안정성과 시간적 일관성에 어떻게 기여하는가?
  • RQ3실루엣, 세그멘테이션, 텍스처, 노멀 맵과 같은 다중 이미지 측정값의 미분 가능 렌더링이 기하학적 정확성과 시각적 사실성에 얼마나 기여하는가?
  • RQ4노멀 맵 감독과 표면 피팅을 통해 단일 영상에서 세밀한 주름 세부 정보를 효과적으로 캡처할 수 있는가?
  • RQ5실제 영상에서 단일 영상 딥러닝 접근법과 템플릿 기반 방법에 비해 제안된 방법의 견고성과 정확도는 어떠한가?

주요 결과

  • 배치 최적화 후 BUFF 데이터셋의 앞좌측 시점에서 평균 점-표면 재구성 오차가 24.7 mm로 측정되었으며, 이는 신체만을 고려한 베이스라인(29.2 mm)보다 유의미하게 낮다.
  • 주름 추출을 추가하면 앞좌측 시점에서 오차는 24.9 mm로 약간 증가하지만, 기하학적 정확도를 떨어뜨리지 않고도 비주얼 사실성 향상이 가능함을 시사한다.
  • 모든 시점(Front, Front-left, Left)에서 재구성 오차가 감소하여, 시점 변화에 대한 강건성과 일관된 성능을 입증한다.
  • 시간적 스무딩과 배치 최적화가 시각적 품질과 시간적 일관성을 향상시켰지만, 정량적 오차에는 미미한 영향을 미쳐 안정적인 추적을 보여준다.
  • 정성적 결과는 볼륨, 깊이 맵, 암시적 함수를 사용한 단일 영상 회귀 방법에 비해 뛰어난 시간적 견고성과 일관된 3D 대응을 보여준다.
  • 제안된 방법은 템플릿 데이터 없이 다양한 실제 영상에서 복잡한 주름과 변형을 포함한 현실적인 의류 역학을 성공적으로 캡처한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.