Skip to main content
QUICK REVIEW

[논문 리뷰] BlendGAN: Implicitly GAN Blending for Arbitrary Stylized Face Generation

Mingcong Liu, Qiang Li|arXiv (Cornell University)|2021. 10. 22.
Generative Adversarial Networks and Image Synthesis인용 수 12
한 줄 요약

BlendGAN은 자가지도 학습 스타일 인코더와 가중 침투 모듈(WBM)을 사용하여 얼굴과 스타일 잠재 코드를 암묵적으로 통합함으로써, 스타일별 미세조정 없이도 고해상도이고 다양한 스타일의 얼굴 생성을 위한 통합 GAN 프레임워크를 제안한다. 새로운 대규모 예술적 얼굴 데이터셋(AAHQ)을 사용하여 참조 유도 및 잠재 유도 합성에서 각각 FID 점수 3.79와 15.08의 최신 기준 성능을 달성한다.

ABSTRACT

Generative Adversarial Networks (GANs) have made a dramatic leap in high-fidelity image synthesis and stylized face generation. Recently, a layer-swapping mechanism has been developed to improve the stylization performance. However, this method is incapable of fitting arbitrary styles in a single model and requires hundreds of style-consistent training images for each style. To address the above issues, we propose BlendGAN for arbitrary stylized face generation by leveraging a flexible blending strategy and a generic artistic dataset. Specifically, we first train a self-supervised style encoder on the generic artistic dataset to extract the representations of arbitrary styles. In addition, a weighted blending module (WBM) is proposed to blend face and style representations implicitly and control the arbitrary stylization effect. By doing so, BlendGAN can gracefully fit arbitrary styles in a unified model while avoiding case-by-case preparation of style-consistent training images. To this end, we also present a novel large-scale artistic face dataset AAHQ. Extensive experiments demonstrate that BlendGAN outperforms state-of-the-art methods in terms of visual quality and style diversity for both latent-guided and reference-guided stylized face synthesis.

연구 동기 및 목표

  • 각 스타일당 수백 장의 스타일 일관성 있는 이미지가 필요한 기존 GAN 기반 스타일화 방법의 한계를 해결한다.
  • 재학습이나 미세조정 없이도 임의의 예술 스타일에 대해 통합된 단일 모델로 스타일화된 얼굴을 생성할 수 있도록 한다.
  • 잠재 코드 상호작용을 조작하여 스타일화 강도를 조절할 수 있는 융통성 있고 제어 가능한 블렌딩 메커니즘을 개발한다.
  • 일반적인 스타일 표현을 학습하기 위해 대규모이고 다양한 예술적 얼굴 데이터셋(AAHQ)을 도입한다.
  • 잠재 유도 및 참조 유도 스타일화 얼굴 합성에서 모두 높은 시각적 품질과 스타일 일관성을 달성한다.

제안 방법

  • AAHQ 데이터셋에서 인스턴스 차별 기반으로 자가지도 학습 스타일 인코더를 훈련하여 예술적 얼굴 이미지에서 분리된 스타일 표현을 추출한다.
  • 학습 가능한 블렌딩 가중치를 통해 표준 정규분포에서 온 얼굴 잠재 코드와 스타일 잠재 코드를 암묵적으로 융합하는 가중 침투 모듈(WBM)을 도입한다.
  • 세 개의 판별자 사용: 자연 얼굴 이미지(D_face), 스타일화된 얼굴 이미지(D_style), 스타일-잠재 일관성(D_style_latent).
  • 이중 훈련 전략 적용: 먼저 AAHQ에서 스타일 인코더를 사전 훈련하고, 이후 FFHQ와 AAHQ에서 생성자, WBM, 판별자를 함께 훈련한다.
  • 랜덤 잠재 코드 또는 참조 이미지의 스타일 코드를 조건으로 하여 WBM을 이용해 잠재 유도 및 참조 유도 합성을 모두 가능하게 한다.
  • WBM의 지표를 활용해 얼굴 및 스타일 특징 간의 블렌딩 비율을 제어함으로써 세밀한 스타일화 제어를 가능하게 한다.

실험 결과

연구 질문

  • RQ1스タイル별 미세조정이나 대규모 스타일 일관성 데이터셋이 필요 없이 단일 GAN 모델이 임의의 예술 스타일에 대해 스타일화된 얼굴을 생성할 수 있는가?
  • RQ2일반적인 예술 데이터셋에서 학습된 자가지도 스타일 인코더가 다양한 분리된 스타일 표현을 얼마나 효과적으로 포착하는가?
  • RQ3가중 침투 모듈이 얼굴과 스타일 잠재 코드의 제어 가능한 암묵적 융합을 통해 고해상도 스타일화를 얼마나 잘 실현할 수 있는가?
  • RQ4제안된 프레임워크가 잠재 유도 및 참조 유도 설정 모두에서 기존 방법보다 높은 시각적 품질과 스타일 다양성을 달성하는가?
  • RQ5모델은 명시적 재학습 없이도 새로운 스타일에 일반화될 수 있으며, 참조 이미지와의 스타일 일관성은 어떻게 유지하는가?

주요 결과

  • BlendGAN은 참조 유도 스타일화 얼굴 합성에서 Fréchet Inception Distance(FID) 점수 3.79를 기록하여 이전 최신 기준 방법들을 크게 능가한다.
  • 잠재 유도 합성에서는 FID 점수 15.08을 달성하여 다양한 고해상도 스타일화된 얼굴 생성에서 뛰어난 성능을 보여준다.
  • BlendGAN의 LPIPS 점수는 비교된 모든 방법 중에서 가장 높아, 참조 스타일에 대한 우수한 스타일 다양성과 인지적 유사성을 나타낸다.
  • 모델은 다양한 피부 톤에 걸쳐 높은 품질의 생성을 유지하며, FFHQ로 훈련된 일부 이전 GAN들과 달리 밝은 피부 톤에 대한 명백한 편향이 없다.
  • 가중 침투 모듈은 스타일화 강도를 효과적으로 제어할 수 있으며, 높은 블렌딩 비율에서도 시각적 품질이 유지된다.
  • AAHQ 데이터셋의 일반성과 자가지도 스타일 인코더 덕분에 모델은 새로운 예술 스타일로 잘 일반화된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.