Skip to main content
QUICK REVIEW

[논문 리뷰] ARCH: Animatable Reconstruction of Clothed Humans

Zeng Huang, Yuanlu Xu|arXiv (Cornell University)|2020. 04. 08.
3D Shape Modeling and Analysis참고 문헌 55인용 수 12
한 줄 요약

ARCH는 단일 단일 RGB 이미지에서 세부 정보가 풍부하고 애니메이션 준비가 된 3D 옷 입은 인간 애니메이션 캐릭터를 복원하기 위한 엔드 투 엔드 프레임워크를 제안한다. 학습된 의미 공간과 변형 필드를 활용해 자세 변형을 정규화하고, 정밀한 미세 조정을 위해 투과도 인식 가능한 가분성 렌더링을 사용함으로써, 공개 벤치마크에서 최신 기술 대비 50% 이상 낮은 복원 오차를 달성하면서도 애니메이션에 바로 사용할 수 있는 고해상도 모델을 생성한다.

ABSTRACT

In this paper, we propose ARCH (Animatable Reconstruction of Clothed Humans), a novel end-to-end framework for accurate reconstruction of animation-ready 3D clothed humans from a monocular image. Existing approaches to digitize 3D humans struggle to handle pose variations and recover details. Also, they do not produce models that are animation ready. In contrast, ARCH is a learned pose-aware model that produces detailed 3D rigged full-body human avatars from a single unconstrained RGB image. A Semantic Space and a Semantic Deformation Field are created using a parametric 3D body estimator. They allow the transformation of 2D/3D clothed humans into a canonical space, reducing ambiguities in geometry caused by pose variations and occlusions in training data. Detailed surface geometry and appearance are learned using an implicit function representation with spatial local features. Furthermore, we propose additional per-pixel supervision on the 3D reconstruction using opacity-aware differentiable rendering. Our experiments indicate that ARCH increases the fidelity of the reconstructed humans. We obtain more than 50% lower reconstruction errors for standard metrics compared to state-of-the-art methods on public datasets. We also show numerous qualitative examples of animated, high-quality reconstructed avatars unseen in the literature so far.

연구 동기 및 목표

  • 제약 없는 단일 영상에서 세부 정보가 풍부하고 3D로 애니메이션 가능한 옷 입은 인간 캐릭터를 복원하는 문제를 해결하기 위해.
  • 기존 방법이 자세 변화, 음영, 애니메이션을 위한 뼈대화가 부족한 점을 극복하기 위해.
  • 표준 애니메이션 파이프라인과 호환되며 동시에 고도로 세밀한 기하학적 구조와 외관 표현을 생성하기 위해.
  • 가분성 렌더링을 통한 픽셀 단위의 감독과 자세 인식 정규화를 통해 복원 정확도를 향상시키기 위해.
  • 추가 뼈대화 없이도 모션 캡처 데이터를 직접 사용해 복원된 캐릭터를 애니메이션할 수 있도록 하기 위해.

제안 방법

  • 3D 옷 입은 인간을 표준 자세 공간으로 매핑하기 위해 의미 공간(SemS)과 의미 변형 필드(SemDF)를 도입하여 자세와 음영으로 인한 모호성을 줄인다.
  • 고주파 표면 세부 정보(예: RBF 기반 관절 거리)와 같은 공간 국소 특징을 갖춘 암묵적 신경 표현을 사용해 주름과 옷 주름 같은 세부 정보를 모델링한다.
  • 입력 이미지와 렌더링된 이미지를 비교함으로써 예측된 법선과 알베도를 향상시키기 위해 투과도 인식 가능한 미세 렌더링-비교 기반의 가분성 렌더러를 활용한다.
  • 2D 이미지에서 예측된 3D 신체 형태와 자세를 기반으로 표준 공간 복원을 초기화하고, 피부 스키닝 웨이트를 자동으로 생성하여 뼈대화를 자동으로 수행한다.
  • 학습 중에 법선과 알베도에 픽셀 단위의 감독을 적용하여 표면 세부 정보와 재조명 정확도를 향상시킨다.
  • 자체적으로 뼈대화된 표준 공간 메쉬를 구축하여 애니메이션 파이프라인에서 바로 사용할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1단일 영상 기반 3D 복원 방법이 세부 정보가 풍부하고 애니메이션 가능한 옷 입은 인간 캐릭터를 생성할 수 있는가?
  • RQ2제약 없는 영상에서 발생하는 자세 변화와 음영은 어떻게 효과적으로 정규화하여 복원 정확도를 향상시킬 수 있는가?
  • RQ3투과도 인식 가능한 감독을 통한 가분성 렌더링은 암묵적 3D 표현에서 법선과 알베도의 현실감을 향상시킬 수 있는가?
  • RQ4의미 변형 필드를 갖춘 암묵적 함수가 옷 주름과 머리카락 같은 미세한 세부 정보를 어느 정도 정확하게 복원할 수 있는가?
  • RQ5복원된 캐릭터는 추가 처리 없이도 표준 모션 캡처 시퀀스를 직접 사용해 애니메이션할 수 있는가?

주요 결과

  • ARCH는 PIFu와 같은 최신 기술 대비 RenderPeople 데이터셋에서 50% 이상, BUFF 데이터셋에서 60% 이상 복원 오차를 감소시켰다.
  • RBF 기반 공간 특징 표현은 정량적 지표와 정량적 세부 정보 유지 측면에서 XYZ 및 L2 특징보다 뛰어난 성능을 보였다.
  • 투과도 인식 가능한 가분성 렌더링을 통한 미세 렌더링-비교 기법은 법선 추정을 크게 향상시키고 시각적 잡음을 줄였다.
  • 이 프레임워크는 이전 방법이 포착하지 못한 바지 틈새, 신발 뒷굽, 미세한 주름과 같은 복잡한 의복 세부 정보를 성공적으로 복원했다.
  • 복원된 캐릭터는 자체적으로 뼈대화되어 있으며, 리타겟팅된 Mixamo 모션 시퀀스를 직접 사용해 애니메이션할 수 있어 완전한 애니메이션 준비 상태임을 입증했다.
  • 모델은 도전적인 자세와 자기 접촉 상황에서도 잘 일반화되지만, 희귀하거나 심하게 음영이 드리운 자세는 여전히 도전 과제로 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.