Skip to main content
QUICK REVIEW

[논문 리뷰] AlteredAvatar: Stylizing Dynamic 3D Avatars with Fast Style Adaptation

Thu Nguyen-Phuoc, Gabriel Schwartz|arXiv (Cornell University)|2023. 05. 30.
Human Motion and Animation인용 수 5
한 줄 요약

AlteredAvatar는 메타학습 프레임워크를 도입하여 단 몇 번의 최적화 단계만으로도 동적 3D 아바타를 새로운 스타일로 빠르고 고해상도의 스타일 전이가 가능하게 한다. 메타학습을 통해 최적의 네트워크 초기화를 학습함으로써 직접 최적화 수준의 품질을 달성하면서도 텍스트 또는 이미지 프롬프트를 통한 민감한 스타일 제어를 가능하게 한다.

ABSTRACT

This paper presents a method that can quickly adapt dynamic 3D avatars to arbitrary text descriptions of novel styles. Among existing approaches for avatar stylization, direct optimization methods can produce excellent results for arbitrary styles but they are unpleasantly slow. Furthermore, they require redoing the optimization process from scratch for every new input. Fast approximation methods using feed-forward networks trained on a large dataset of style images can generate results for new inputs quickly, but tend not to generalize well to novel styles and fall short in quality. We therefore investigate a new approach, AlteredAvatar, that combines those two approaches using the meta-learning framework. In the inner loop, the model learns to optimize to match a single target style well; while in the outer loop, the model learns to stylize efficiently across many styles. After training, AlteredAvatar learns an initialization that can quickly adapt within a small number of update steps to a novel style, which can be given using texts, a reference image, or a combination of both. We show that AlteredAvatar can achieve a good balance between speed, flexibility and quality, while maintaining consistency across a wide range of novel views and facial expressions.

연구 동기 및 목표

  • 재훈련 없이도 새로운, 미리 보지 못한 스타일로 동적 3D 아바타를 신속하게 스타일 전이할 수 있도록 하는 것.
  • 직접 최적화(느림)와 피드포워드 네트워크(낮은 일반화 능력 및 품질)의 한계를 극복하여 3D 아바타 스타일 전이에 적합한 방법을 개발하는 것.
  • CLIP 기반 특징 인코딩을 통해 텍스트 기반, 참조 이미지 기반, 또는 이 둘의 조합을 통한 민감한 스타일 제어를 지원하는 것.
  • 스틸화 과정 중에 표정과 시점 변화에 관계없이 정체성 유지 및 일관성을 유지하는 것.
  • 기본 아바타 표현에 추가 파rameter를 추가하지 않고도 고해상도의 스타일 전이를 달성하는 것.

제안 방법

  • 메타학습을 활용해 단 몇 번의 최적화 단계 내에 새로운 스타일로 신속하게 적응할 수 있는 네트워크 초기화를 학습한다.
  • 이중 루프 최적화 프레임워크를 사용: 내부 루프는 단일 스타일에 대해 최적화하고, 외부 루프는 다양한 스타일 간의 일반화 가능한 초기화를 학습한다.
  • 텍스트 스타일 기술서를 인코딩하기 위해 CLIP 특징을 사용하여 입력 텍스트와 목표 스타일 간의 의미적 일치를 달성한다.
  • CLIP 기반 텍스트 특징과 참조 이미지 특징을 결합하여 텍스트 + 이미지 조합 스타일 제어를 가능하게 한다.
  • 정체성 손실($\mathcal{L}_{\text{ID}}$)과 스타일 손실($\mathcal{L}_{\text{style}}$)을 최적화 과정에 적용하여 정체성을 유지하고 스타일을 적용한다.
  • 추론 시에 인stant Avatar 네트워크의 작은 부분만 미세조정하여 추론 속도를 높이고 확장성을 유지한다.

실험 결과

연구 질문

  • RQ1메타학습된 초기화가 최소한의 최적화 단계로 동적 3D 아바타의 빠르고 고품질의 스타일 전이를 가능하게 할 수 있는가?
  • RQ2이미지 전용 방법과 비교해 CLIP 기반 텍스트 인코딩이 의미적으로 유의미한 스타일 전이를 얼마나 잘 지원하는가?
  • RQ3텍스트와 이미지 프롬프트를 조합하면 아바타 스타일 전이의 유연성과 표현력이 향상되는가?
  • RQ4직접 최적화 및 피드포워드 스타일 전이 네트워크와 비교해 AlteredAvatar는 품질과 속도에서 어떤가?
  • RQ5AlteredAvatar는 표정과 시점 변화에 걸쳐 정체성과 일관성을 얼마나 잘 유지하는가?

주요 결과

  • AlteredAvatar는 단 50회의 최적화 단계 이후에도 직접 최적화 수준의 스타일 전이 품질을 달성하면서도 훨씬 더 빠른 속도를 보였다.
  • 특히 다중 도메인 환경에서 태스크 믹싱과 HyperDomainNet보다 일반화 능력에서 뛰어난 성능을 보였다.
  • CLIP 특징을 사용함으로써 텍스트 기반 기술서만으로도 효과적인 스타일 전이가 가능했으며, 의미적으로 일관된 결과를 생성했다.
  • 다양한 표정과 시점에서 스타일 전이 결과가 일관되게 유지되었고, 아바타의 정체성이 잘 보존되었다.
  • 높은 시각적 정확도를 유지했으며, 기준 방법에서 관찰되는 표정 억제 및 비자연스러운 조명 효과를 피했다.
  • 정체성 유지 하이퍼파rameter $\lambda_{\text{ID}}$는 스타일 전이 강도와 원본 정체성 유지 품질 간의 균형을 효과적으로 제어했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.