Skip to main content
QUICK REVIEW

[논문 리뷰] Global-correlated 3D-decoupling Transformer for Clothed Avatar Reconstruction

Zechuan Zhang, Li Sun|arXiv (Cornell University)|2023. 09. 24.
Human Pose and Action Recognition인용 수 7
한 줄 요약

이 논문은 단일 이미지에서 3D 옷 입은 아바타 재구성에 대해 새로운 트랜스포머 기반 방법인 GTA를 제안한다. 이 방법은 전역 상관관계를 가진 이미지 특징을 캡처하기 위해 비전 트랜스포머 인코더를 사용하고, 학습 가능한 임bedding과 크로스 어텐션을 활용한 3D 분리 디코더를 통해 삼면체 특징을 분리한다. 모델은 CAPE-FP에서 0.8cm 이하의 캄퍼 거리로 최신 기술 수준(SOTA) 성능을 달성하며, 특히 도전적인 자세와 느슨한 옷을 입은 경우에 더 높은 PSNR 점수로 텍스처 품질을 향상시킨다.

ABSTRACT

Reconstructing 3D clothed human avatars from single images is a challenging task, especially when encountering complex poses and loose clothing. Current methods exhibit limitations in performance, largely attributable to their dependence on insufficient 2D image features and inconsistent query methods. Owing to this, we present the Global-correlated 3D-decoupling Transformer for clothed Avatar reconstruction (GTA), a novel transformer-based architecture that reconstructs clothed human avatars from monocular images. Our approach leverages transformer architectures by utilizing a Vision Transformer model as an encoder for capturing global-correlated image features. Subsequently, our innovative 3D-decoupling decoder employs cross-attention to decouple tri-plane features, using learnable embeddings as queries for cross-plane generation. To effectively enhance feature fusion with the tri-plane 3D feature and human body prior, we propose a hybrid prior fusion strategy combining spatial and prior-enhanced queries, leveraging the benefits of spatial localization and human body prior knowledge. Comprehensive experiments on CAPE and THuman2.0 datasets illustrate that our method outperforms state-of-the-art approaches in both geometry and texture reconstruction, exhibiting high robustness to challenging poses and loose clothing, and producing higher-resolution textures. Codes will be available at https://github.com/River-Zhang/GTA.

연구 동기 및 목표

  • 현재 3D 옷 입은 아바타 재구성 방법이 2D 특징에 크게 의존하고 있으며, 일관되지 않은 쿼리 전략을 사용하는 데서 비롯되는 한계를 해결하기 위해.
  • 전역 3D 특징 상관관계를 활용하여 복잡한 자세와 느슨한 옷을 입은 경우에도 재구성 정확도와 강건성을 향상시키기 위해.
  • 트랜스포머와 학습 가능한 임베딩을 사용하여 효율적이고 효과적인 3D 특징 분리 메커니즘을 개발하기 위해.
  • 공간적 정렬 정보와 인간 신체 사전 지식을 융합하여 하이브리드 쿼리 전략을 통해 특징 융합을 향상시키기 위해.
  • 가상 피팅 및 애니메이션과 같은 애플리케이션을 위해 고해상도로 애니메이션 가능한 3D 아바타를 제공하기 위해.

제안 방법

  • 비전 트랜스포머 기반 인코더가 단일 단안 이미지에서 전역 상관관계 특징을 추출한다.
  • 학습 가능한 임베딩을 쿼리로 사용하는 크로스 어텐션을 활용하여 3D 분리 디코더가 세 개의 수직 평면에 걸쳐 삼면체 3D 특징을 분리한다.
  • 공간 쿼리(정렬을 위한)와 사전 강화 쿼리(신체 구조 안내를 위한)를 융합하는 하이브리드 사전 융합 전략을 통해 특징 융합을 향상시킨다.
  • 삼면체 표현을 활용하여 메모리 비용을 줄이면서도 고해상도 3D 기하학적 및 텍스처 재구성 품질을 유지한다.
  • 모델은 THuman2.0 데이터셋에서 엔드 투 엔드로 훈련되고 기하학적 및 텍스처 최적화를 위해 미세조정된다.
  • 모델은 파arametric 3D 신체에 대해 자세 전이 및 특징 교체를 지원함으로써 애니메이션 및 가상 피팅과 같은 후속 응용 프로그램을 가능하게 한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 아키텍처가 단일 이미지에서 3D 재구성 성능을 향상시키기 위해 효과적으로 전역 상관관계 2D 이미지 특징을 캡처할 수 있는가?
  • RQ2학습 가능한 임베딩과 크로스 어텐션을 활용해 삼면체 3D 특징을 효과적으로 분리하고 재구성할 수 있는가?
  • RQ3하이브리드 융합 전략에서 공간 쿼리와 사전 강화 쿼리를 함께 사용할 경우, 각각을 별도로 사용하는 것보다 기하학적 및 텍스처 재구성 품질이 향상되는가?
  • RQ4제안된 방법은 복잡한 자세와 느슨한 옷을 입은 경우와 같은 도전적인 케이스에 일반화되어 있으며, 기존 SOTA 방법을 초월하는가?
  • RQ5재구성된 3D 아바타가 애니메이션 및 가상 피팅 응용에 얼마나 효과적으로 활용될 수 있는가?

주요 결과

  • GTA는 CAPE-FP 테스트 세트에서 0.8cm 이하의 캄퍼 거리를 달성하여 단일 시야 3D 옷 입은 아바타 재구성에서 이 임계값을 돌파한 최초의 사례이다.
  • 모델은 최신 기술 수준의 방법들과 비교해 뛰어난 텍스처 재구성 성능을 보이며, 더 높은 PSNR 점수를 기록한다.
  • 하이브리드 사전 융합 전략은 공간 쿼리 전용 또는 사전 강화 쿼리 전용 방법보다 기하학적 및 텍스처 품질에서 뛰어난 성능을 보인다.
  • 크로스 어텐션과 학습 가능한 쿼리를 활용한 3D 분리 디코더는 기초 컨볼루션 네트워크 및 단순 자기 어텐션만을 사용하는 트랜스포머보다 기하학적 정확도를 크게 향상시킨다.
  • 모델은 복잡한 자세와 느슨한 옷을 입은 실외 이미지에 대해서도 잘 일반화되어 높은 재구성 정밀도를 유지한다.
  • 자세 전이 및 파arametric 3D 신체에 대한 특징 교체를 지원함으로써, 모델은 애니메이션 및 가상 피팅 응용에 실용적으로 활용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.