Skip to main content
QUICK REVIEW

[논문 리뷰] Faces à la Carte: Text-to-Face Generation via Attribute Disentanglement

Tianren Wang, Teng Zhang|arXiv (Cornell University)|2020. 06. 13.
Generative Adversarial Networks and Image Synthesis참고 문헌 24인용 수 7
한 줄 요약

이 논문은 자연어 기반 기술서술에서 높은 해상도(1024×1024)의 얼굴 합성을 실현하면서도 강력한 텍스트-이미지 일致성과 높은 다양성을 확보하기 위해 다중라벨 BERT 분류기와 최적화된 MobileNet 이미지 인코더를 통해 얼굴 특징을 분리하는 TTF-HD라는 텍스트-얼굴 생성 모델을 제안한다. 이 방법은 재가중 처리된 차별화된 벡터를 사용해 노이즈 벡터를 40개의 수직 특성 축을 따라 조작함으로써 자연어 기반 기술서술에서 다양하고 고해상도의 얼굴을 조건부로 생성할 수 있게 하며, Inception 스코어, 코사인 유사도, 인지적 다양성 측면에서 이전 방법들을 능가한다.

ABSTRACT

Text-to-Face (TTF) synthesis is a challenging task with great potential for diverse computer vision applications. Compared to Text-to-Image (TTI) synthesis tasks, the textual description of faces can be much more complicated and detailed due to the variety of facial attributes and the parsing of high dimensional abstract natural language. In this paper, we propose a Text-to-Face model that not only produces images in high resolution (1024x1024) with text-to-image consistency, but also outputs multiple diverse faces to cover a wide range of unspecified facial features in a natural way. By fine-tuning the multi-label classifier and image encoder, our model obtains the vectors and image embeddings which are used to transform the input noise vector sampled from the normal distribution. Afterwards, the transformed noise vector is fed into a pre-trained high-resolution image generator to produce a set of faces with the desired facial attributes. We refer to our model as TTF-HD. Experimental results show that TTF-HD generates high-quality faces with state-of-the-art performance.

연구 동기 및 목표

  • 자연어 기반 기술서술에서 고해상도, 다양한 얼굴을 생성하는 데 도전하는 데 목적을 두며.
  • 얼굴 특징을 40차원 수직 특징 공간으로 분리함으로써 텍스트-얼굴 일치도를 향상시키는 데 목적을 두며.
  • 단일 텍스트 기술서술에서 여러 다양성을 가진 얼굴 이미지를 생성함으로써 실제 응용 분야(예: 범죄 수사)에서 최적의 일치를 선택할 수 있도록 하는 데 목적을 두며.
  • 합의 위반을 초래하는 얼굴 데이터셋에 대한 의존도를 줄이기 위해 대표성이 떨어지는 소수 민족 집단의 조건부 합성을 가능하게 하는 데 목적을 두며.
  • 일반적으로 편향과 낮은 특징 분리도 문제를 겪는 기존 얼굴 생성 방법에 대한 강건하고 윤리적인 대안을 확립하는 데 목적을 두며.

제안 방법

  • 사전 학습된 BERT 기반 다중라벨 분류기가 입력 기술서술에서 희소한 40차원 텍스트 임베딩을 생성한다.
  • 최적화된 MobileNet 모델이 이미지에서 40개의 얼굴 특징을 예측함으로써 텍스트와 이미지 특징 공간 간의 정렬을 가능하게 한다.
  • 노이즈 벡터와 예측된 레이블을 사용해 40축의 수직 좌표계를 구성함으로써 잠재공간의 방향 조작이 가능해진다.
  • 스텝 크기가 1.2인 벡터를 재가중 처리하고, 차별화된 벡터를 사용해 노이즈 벡터를 재조정함으로써 원하는 특성 축을 따라 안정적인 이동을 보장한다.
  • 수정된 노이즈 벡터를 사전 학습된 StyleGAN2 생성자에 입력하여 고해상도이며 분리된 얼굴 이미지를 생성한다.
  • 동일한 잠재 노이즈 벡터에 대해 특성별 변환을 적용함으로써 다양한 얼굴의 조건부 생성이 가능해진다.

실험 결과

연구 질문

  • RQ1텍스트-얼굴 생성 모델은 자연어 기술서술에 강력한 의미 일치도를 유지하면서도 고해상도(1024×1024) 이미지를 생성할 수 있는가?
  • RQ2모델은 단일 텍스트 기술서술에서 특정 특징을 유지하면서도 다수의 다양한 얼굴 이미지를 생성할 수 있는가?
  • RQ3얼굴 특징을 40차원 수직 공간으로 분리하면 생성된 얼굴 특징에 대한 제어력을 향상시킬 수 있는가?
  • RQ4AttnGAN과 같은 최신 기술 모델과 비교했을 때, 제안된 방법은 이미지 품질, 다양성, 텍스트-이미지 유사도 측면에서 어떤가?
  • RQ5이 모델은 얼굴 생성에서 데이터 프라이버시 및 표현 편향과 관련된 윤리적 문제를 어느 정도 완화하는가?

주요 결과

  • TTF-HD는 Inception 스코어(IS) 1.117 ± 0.127을 기록하여 AttnGAN의 1.062 ± 0.051을 능가함으로써 우수한 이미지 품질을 입증한다.
  • 모델은 코사인 유사도(CS) 스코어 0.664를 기록하여 AttnGAN의 0.511보다 유의미하게 높게 나타나 텍스트-얼굴 일치도가 뛰어나다는 것을 보여준다.
  • LPIPS 스코어 0.583 ± 0.002는 특히 단일 문장 기술서술 하에서 생성된 이미지의 강력한 인지적 다양성을 나타낸다.
  • 단절 실험 결과, 노이즈 벡터 조작 연산을 모두 적용할 경우 IS(1.122 ± 0.043), CS(0.754), LPIPS(0.634)의 최적의 균형을 확보함으로써 방법의 효과성을 확인한다.
  • 모든 제안된 연산을 사용한 그룹 A는 가장 높은 다양성과 두 번째로 높은 IS 및 CS 스코어를 기록하여 방법의 강건성을 확인한다.
  • 강력한 성능에도 불구하고 모델은 종종 아티팩트나 낮은 일관성을 가진 이미지를 생성하는 경우가 있어, 분류기 정확도 및 잠재공간의 분리도에 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.