Skip to main content
QUICK REVIEW

[논문 리뷰] AnyFace: Free-style Text-to-Face Synthesis and Manipulation

Jianxin Sun, Qiyao Deng|arXiv (Cornell University)|2022. 03. 29.
Face recognition and analysis인용 수 5
한 줄 요약

AnyFace는 자유형 텍스트에서 얼굴으로의 합성과 조작을 위한 최초의 프레임워크를 제안하며, CLIP 기반의 특징 정렬과 새로운 다각도 트리플릿 손실을 갖춘 이중 스트림 아키텍처를 사용하여 임의의 텍스트 기술에 기반한 고품질, 고다양도의 얼굴 생성을 가능하게 한다. Multi-modal CelebA-HQ 및 CelebAText-HQ에서 최신 기술 수준의 성능을 달성하며, 캡션 수, 내용, 형식에 제약 없이 오픈월드, 다중 캡션, 연속적인 텍스트 기반 얼굴 조작을 지원한다.

ABSTRACT

Existing text-to-image synthesis methods generally are only applicable to words in the training dataset. However, human faces are so variable to be described with limited words. So this paper proposes the first free-style text-to-face method namely AnyFace enabling much wider open world applications such as metaverse, social media, cosmetics, forensics, etc. AnyFace has a novel two-stream framework for face image synthesis and manipulation given arbitrary descriptions of the human face. Specifically, one stream performs text-to-face generation and the other conducts face image reconstruction. Facial text and image features are extracted using the CLIP (Contrastive Language-Image Pre-training) encoders. And a collaborative Cross Modal Distillation (CMD) module is designed to align the linguistic and visual features across these two streams. Furthermore, a Diverse Triplet Loss (DT loss) is developed to model fine-grained features and improve facial diversity. Extensive experiments on Multi-modal CelebA-HQ and CelebAText-HQ demonstrate significant advantages of AnyFace over state-of-the-art methods. AnyFace can achieve high-quality, high-resolution, and high-diversity face synthesis and manipulation results without any constraints on the number and content of input captions.

연구 동기 및 목표

  • 기존 텍스트-이미지 모델이 얼굴 합성에 있어 고정된, 데이터셋 내 캡션에 국한된 제약을 해결하기 위해.
  • 임의의 수, 내용, 형식의 텍스트 기술에 기반한 자유형 텍스트-얼굴 생성 및 조작을 가능하게 하기 위해.
  • 일对일 텍스트-이미지 정렬을 초월하여 텍스트 기반 얼굴 합성에서 얼굴의 다양성과 의미적 일관성을 향상시키기 위해.
  • 메타버스, 소셜미디어, 디지털 코스메틱과 같은 오픈월드 응용을 지원하는 프레임워크 개발을 위해.
  • 이전 방법의 고정된 캡션 템플릿과 제한된 어휘에 기인한 제약을 새로운 다중모달 디스틸레이션 및 트리플릿 손실 메커니즘을 통해 극복하기 위해.

제안 방법

  • 이중 스트림 아키텍처를 제안: 한 스트림은 텍스트-얼굴 합성을 위해, 다른 스트림은 얼굴 이미지 재구성 위해 설계되며, 상호작용을 통한 다중모달 학습을 수행한다.
  • CLIP 인코더가 텍스트 및 이미지 특징을 추출하여, 데이터셋 외 기술에 대한 제로샷 일반화를 가능하게 한다.
  • 교차모달 디스틸레이션(CMD) 모듈이 교차모달 전이 손실을 통해 두 스트림 간 언어적 특징과 시각적 특징을 정렬하며, 엄격한 일대일 특징 매칭을 피한다.
  • 다양도 트리플릿 손실(DT 손실)을 도입하여, 헤어스타일, 액세서리 등 세밀한 얼굴 특징의 다양성을 증진하면서도 텍스트의 관련성을 유지한다.
  • 텍스트 임베딩 크기 조절을 통해 얼굴 조작에서 연속적 제어를 가능하게 하여 특징 간 부드러운 전환을 구현한다.
  • CLIP로 인코딩된 텍스트 프롬프트를 활용한 StyleGAN 기반 생성 기법을 통해 현실적이고 고해상도의 얼굴을 합성한다.
Figure 2 : Overview of AnyFace. It consists of a face synthesis network and a face reconstruction network. Text Enc and Image Enc represent CLIP text and image encoder respectively. Dec is the pre-trained StyleGAN decoder. (a) Detailed architecture of Cross Modal Distillation (CMD) module. (b) For t
Figure 2 : Overview of AnyFace. It consists of a face synthesis network and a face reconstruction network. Text Enc and Image Enc represent CLIP text and image encoder respectively. Dec is the pre-trained StyleGAN decoder. (a) Detailed architecture of Cross Modal Distillation (CMD) module. (b) For t

실험 결과

연구 질문

  • RQ1고정 템플릿이나 어휘 제약 없이, 데이터셋 외의 임의의 기술에 대해 텍스트-얼굴 모델이 일반화될 수 있는가?
  • RQ2복잡한 다중 캡션 기술에 기반한 텍스트-이미지 합성에서 의미적 일관성을 유지하면서 얼굴의 다양성을 어떻게 향상시킬 수 있는가?
  • RQ3일대일 텍스트-이미지 특징 매칭을 더 민첩하고 다대일 정렬 전략으로 대체할 경우 어떤 영향을 미치는가?
  • RQ4교차모달 디스틸레이션과 트리플릿 손실을 갖춘 이중 스트림 프레임워크가 기존의 다중 캡션 T2I 방법보다 얼굴 합성 및 조작에서 더 뛰어난 성능을 낼 수 있는가?
  • RQ5자연어 기반 기술을 사용해 얼굴 조작을 연속적이고 세밀하게 제어할 수 있는 정도는 어느 정도인가?

주요 결과

  • AnyFace는 Multi-modal CelebA-HQ 및 CelebAText-HQ에서 최신 기술 수준의 성능을 달성하며, 이전 방법 대비 FID 및 시각적 품질에서 뚜렷한 향상을 보였다.
  • 다양도 트리플릿 손실(DT 손실)은 얼굴 다양성을 크게 향상시켜, 미소나 짧은 머리카락과 같은 공통 특징에 대한 과적합을 줄였다.
  • 교차모달 전이 손실(CMT)은 수렴 속도를 가속화하고 FID 성능을 향상시켰으며, 아블레이션 버전 대비 전체 모델이 더 낮은 FID 값을 더 빨리 달성했다.
  • 정성적 결과에서는 AnyFace가 추상적이거나 다중 문장 기술(예: 'bad news' → 슬픈 표정)에도 불구하고 현실적이고 다양한 얼굴을 생성함을 보였다.
  • 텍스트 기반 조작은 연속적 제어를 가능하게 하였으며, 텍스트의 관련성 증가에 따라 더 부드럽고 정확한 특징 변화(예: 머리카락 색상, 표정, 나이)를 구현하였다.
  • 모델은 데이터셋 외 기술에 대해 성공적으로 일반화되었으며, 예를 들어 'PhD'에 대해 'mortarboard' 또는 'programmer'에 대해 'bald'를 인식함으로써 의미 개념의 제로샷 이해 능력을 입증하였다.
Figure 3 : Comparison between (a) pairwise loss and (b) diverse triplet loss. The pairwise loss learns an one-to-one mapping from text embedding $w_{t}$ to target $w$ , but in fact it often converges to average embedding $\overline{w}$ with an unique result. In contrast, diverse triplet loss follows
Figure 3 : Comparison between (a) pairwise loss and (b) diverse triplet loss. The pairwise loss learns an one-to-one mapping from text embedding $w_{t}$ to target $w$ , but in fact it often converges to average embedding $\overline{w}$ with an unique result. In contrast, diverse triplet loss follows

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.