Skip to main content
QUICK REVIEW

[논문 리뷰] AG3D: Learning to Generate 3D Avatars from 2D Image Collections

Zijian Dong, Xu Chen|arXiv (Cornell University)|2023. 05. 03.
3D Shape Modeling and Analysis인용 수 4
한 줄 요약

AG3D는 2D 이미지 컬렉션에서 비정형적인 구조를 가진 2D 이미지 집합으로부터 고해상도의 3D 아바타를 합성할 수 있는 새로운 적대적 생성 모델을 제안한다. 이 모델은 효율적인 운동 모듈을 갖춘 통합형 3D 생성기와 여러 전문화된 판별기(노멀 매핑 및 얼굴 영역에 특화된 판별기 포함)를 사용하여 기하학적 구조와 외관의 현실성 있는 표현을 달성하며, 드레스나 스커트와 같은 느슨한 옷차림까지 자연스럽게 모델링한다. 이로 인해 기하학적 구조와 외관 품질 측면에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

While progress in 2D generative models of human appearance has been rapid, many applications require 3D avatars that can be animated and rendered. Unfortunately, most existing methods for learning generative models of 3D humans with diverse shape and appearance require 3D training data, which is limited and expensive to acquire. The key to progress is hence to learn generative models of 3D avatars from abundant unstructured 2D image collections. However, learning realistic and complete 3D appearance and geometry in this under-constrained setting remains challenging, especially in the presence of loose clothing such as dresses. In this paper, we propose a new adversarial generative model of realistic 3D people from 2D images. Our method captures shape and deformation of the body and loose clothing by adopting a holistic 3D generator and integrating an efficient and flexible articulation module. To improve realism, we train our model using multiple discriminators while also integrating geometric cues in the form of predicted 2D normal maps. We experimentally find that our method outperforms previous 3D- and articulation-aware methods in terms of geometry and appearance. We validate the effectiveness of our model and the importance of each component via systematic ablation studies.

연구 동기 및 목표

  • 애니메이션 및 렌더링을 위한 다양하고 고품질의 3D 아바타 부족 문제를 해결하기 위해, 3D 훈련 데이터의 희소성과 높은 비용으로 인해 제한되는 문제를 해결한다.
  • 특히 관절이 있는 신체와 느슨한 옷차림을 고려할 때, 비정형적인 2D 이미지 컬렉션에서 현실적인 3D 인간 기하학적 구조와 외관을 생성하는 데 도전하는 문제를 해결한다.
  • 3D 감독 없이도 2D 이미지만으로 생성 모델을 학습함으로써 3D 감독에 의존하는 것을 제거함으로써 확장 가능하고 다양한 3D 아바타 생성을 가능하게 한다.
  • 다중 판별기 훈련과 2D 노멀 매핑을 통한 기하학적 감독를 통해, 매우 제약이 많은 2D에서 3D로의 변환 환경에서도 기하학적 정확성과 인지적 현실감을 향상시킨다.

제안 방법

  • 삼중 평면 표현을 사용한 통합형 3D 생성기를 활용하여 효율적인 볼륨 렲더링과 종합적인 3D 형태 및 외관 모델링을 구현한다.
  • Fast-SNARF 기반의 효율적인 운동 모듈을 통합하여 신체와 느슨한 옷차림의 탄성 변형을 유연하게 가능하게 하며, SMPL 기반의 최근접 이웃 방법을 뛰어넘는 성능을 달성한다.
  • 거친 인간 신체 사전 지식에 따라 유도되는 빈 공간 건너뛰기 전략을 렌더링 중에 적용하여 품질을 손상시키지 않은 채 추론 속도를 향상시킨다.
  • 여러 판별기를 사용한다: 하나는 RGB 이미지, 하나는 예측된 2D 노멀 매핑, 그리고 전용 얼굴 판별기를 통해 중요한 영역에서의 현실감을 향상시킨다.
  • 이미지 및 노멀 매핑 브랜치에서 적대적 손실을 적용하며, 기하학적 감독를 위해 시장에서 구할 수 있는 단일 이미지 노멀 추정기의 결과를 활용한다.
  • 각 판별기가 특정 측면(예: 얼굴, 표면 노멀)에 특화된 다중 브랜치 GAN 설정을 통해 생성기를 최적화함으로써 국소적 정밀도를 향상시킨다.
Figure 2 : Method Overview. Holistic 3D Human Generation: Given a latent vector $\mathbf{z}$ , our method generates human shape $d$ and appearance $\mathbf{c}$ in canonical space. In addition, we compute surface normals $\mathbf{n}$ via the spatial derivatives of the canonical shape which is represe
Figure 2 : Method Overview. Holistic 3D Human Generation: Given a latent vector $\mathbf{z}$ , our method generates human shape $d$ and appearance $\mathbf{c}$ in canonical space. In addition, we compute surface normals $\mathbf{n}$ via the spatial derivatives of the canonical shape which is represe

실험 결과

연구 질문

  • RQ13D 감독 없이도 비정형적인 2D 이미지 컬렉션에서 생성형 3D 모델이 현실적인 인간 기하학적 구조와 외관을 학습할 수 있는가?
  • RQ2부분 기반 분해 없이도, 드레스나 스커트와 같은 느슨한 옷차림의 복잡한 변형을 효과적으로 포착할 수 있는가?
  • RQ3제약이 많은 2D에서 3D로의 변환 환경에서 2D 노멀 매핑 감독을 통합할 경우 기하학적 품질이 얼마나 향상되는가?
  • RQ4얼굴 및 노멀 매핑에 특화된 전문화된 판별기는 단일 전역 판별기와 비교해 인지적 현실감 향상에 기여하는 정도는 어떠한가?
  • RQ5효율적인 운동 모듈을 갖춘 통합형 3D 생성기는 부분 기반 모델보다 연속적이고 흐르는 옷차림을 더 잘 모델링할 수 있는가?

주요 결과

  • AG3D는 기하학적 구조와 외관 품질 측면에서 최신 기술 수준의 성능을 달성하였으며, FID 및 FID_normal와 같은 정량적 지표에서 이전의 3D 및 운동 인식 기반 방법들을 능가한다.
  • 노멀 매핑 판별기의 포함으로 인해 표면 노이즈와 구멍이 크게 감소하였으며, 특히 얼굴 영역에서 뚜렷한 개선이 관찰되었고, FID_normal 지표에서 뚜렷한 향상이 이루어졌다.
  • 얼굴 전용 판별기를 제거할 경우 FID_face 지표가 크게 떨어지며, 이는 얼굴의 현실감 향상에 있어 그 핵심적인 역할을 한다는 것을 확인한다.
  • Fast-SNARF 기반의 운동 모듈은 SMPL 기반 기준 모델이 신체 표면에서 멀리 떨어진 곳에서 아티팩트를 유발하는 것과 달리 스커트와 긴 머리카락을 분리 없이 자연스럽게 변형시킨다.
  • AG3D는 512² 해상도의 이미지에 대해 9.5 FPS로 3D 아바타를 생성하며, EVA3D보다 3배 이상 빠르면서도 기하학적 구조와 외관 품질 측면에서 더 뛰어난 성능을 달성한다.
  • 제거 실험 결과 각 구성 요소(노멀 판별기, 얼굴 판별기, 고도화된 변형 모듈)가 최종 품질 향상에 기여하며, 전체 모델이 모든 지표에서 제거된 변종보다 뛰어난 성능을 보였다.
(a) View Control
(a) View Control

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.