Skip to main content
QUICK REVIEW

[논문 리뷰] Mask-Guided Discovery of Semantic Manifolds in Generative Models

Mengyu Yang, David Rokeby|ArXiv.org|2021. 05. 15.
Generative Adversarial Networks and Image Synthesis참고 문헌 10인용 수 4
한 줄 요약

이 논문은 StyleGAN2와 같은 생성 모델의 잠재 공간에서 매끄럽고 局소적인 의미적 다양체를 발견하기 위해 마스크 유도 최적화 방법을 제안한다. 인지 손실과 스프링 기반 정규화를 사용함으로써, 현실적이고 영역별로 특화된 얼굴 변화를 생성하는 잠재 벡터의 시퀀스를 생성한다. 이는 레이블 데이터나 모델 수정 없이도 제어 가능한 애니메이션과 분리된 조작을 가능하게 한다.

ABSTRACT

Advances in the realm of Generative Adversarial Networks (GANs) have led to architectures capable of producing amazingly realistic images such as StyleGAN2, which, when trained on the FFHQ dataset, generates images of human faces from random vectors in a lower-dimensional latent space. Unfortunately, this space is entangled - translating a latent vector along its axes does not correspond to a meaningful transformation in the output space (e.g., smiling mouth, squinting eyes). The model behaves as a black box, providing neither control over its output nor insight into the structures it has learned from the data. We present a method to explore the manifolds of changes of spatially localized regions of the face. Our method discovers smoothly varying sequences of latent vectors along these manifolds suitable for creating animations. Unlike existing disentanglement methods that either require labelled data or explicitly alter internal model parameters, our method is an optimization-based approach guided by a custom loss function and manually defined region of change. Our code is open-sourced, which can be found, along with supplementary results, on our project page: https://github.com/bmolab/masked-gan-manifold

연구 동기 및 목표

  • 생성 모델의 잠재 공간에서 국소적인 얼굴 특성 변화에 대응하는 매끄럽고 의미 있는 다양체를 밝혀내는 것.
  • 라벨 데이터가 필요 없이 사용자 제어가 가능한 국소적 조작(예: 입 모양, 눈의 표정 등)을 가능하게 하는 것.
  • 이러한 의미적 다양체를 탐색함으로써 고품질의 매끄러운 애니메이션을 생성하는 것.
  • 의도적이고 제어 가능한 방식으로 분리된 얼굴 변화의 기하학적 구조를 탐색하는 것.
  • 감독 학습이나 아키텍처 수정에 의존하지 않는 블랙박스 최적화 기반의 기존 분리 방법에 대한 대안을 제공하는 것.

제안 방법

  • 특정 영역(예: 입)에서의 거리 최소화를 위해 마스크 영역 내에서만 작용하는 영역 특화 손실 함수 ℒ_X 를 정의하며, 인지 또는 L2 거리 기반으로 구현한다.
  • 사용자가 제공한 초기 잠재 벡터 z* 와 직사각형 마스크 M 을 사용하여 조작 대상 얼굴 영역을 고립한다.
  • 연속된 잠재 벡터 간의 매끄러운 전환을 보장하기 위해 스프링 기반 정규화 손실 ℒ_spring 을 적용한다.
  • 잠재 공간 내 경로의 곡률을 최소화하고 균일한 간격을 유지하기 위해 2차 스프링 제약 조건(k=1,2)을 사용한다.
  • L-BFGS 를 사용하여 전체 목적 함수를 최적화함으로써, αℒ_X + βℒ_spring(k=1) + γℒ_spring(k=2) 의 조합 손실을 최소화하는 잠재 벡터의 시퀀스 Z 를 찾는다.
  • 최종적으로 얻어진 잠재 공간 내 경로는 생성기로 복원될 때 시각적으로 매끄럽고 국소적인 얼굴 애니메이션을 생성한다.

실험 결과

연구 질문

  • RQ1라벨 데이터가 없이도 사전 학습된 GAN 의 잠재 공간에서 매끄럽고 국소적인 의미적 다양체를 발견할 수 있는가?
  • RQ2어떻게 최적화를 유도하여 특정 얼굴 영역만 변화시키고 나머지 부분은 안정적으로 유지할 수 있는가?
  • RQ3스프링 기반 정규화는 얼마나 매끄럽고 자연스러운 얼굴 애니메이션을 잠재 공간 경로를 통해 생성할 수 있는가?
  • RQ4이 방법은 다양한 초기 얼굴 이미지와 임의의 마스크 영역에 대해 일반화 가능한가?
  • RQ5의미적 일관성을 유지하는 조작 과정에서 인지 거리와 픽셀 기반 거리 간의 영향은 어떠한가?

주요 결과

  • 이 방법은 마스크 영역에 국한된 매끄럽고 국소적인 얼굴 변화를 성공적으로 생성하며, 비마스크 영역에서는 최소한의 왜곡을 유발한다.
  • LPIPS 를 사용한 인지 손실이 L2 거리보다 얼굴 질감과 구조에서 더 자연스러운 전이를 만들어내는 데 효과적이다.
  • 스프링 정규화는 잠재 공간 내 곡률이 낮고 간격이 균일한 경로를 효과적으로 생성하여 고품질의 애니메이션을 가능하게 한다.
  • 보조 자료에 제시된 여러 예시를 통해 다양한 초기 얼굴과 마스크 영역에 대해 일반화가 가능함을 입증하였다.
  • 모델 가중치 수정이나 특성 애너테이션 없이도 의미 있는 의미적 다양체를 최적화 과정이 탐색한다.
  • 제약 없는 사용자 정의 마스크를 통해 입 모양, 눈의 표정 등 얼굴 특성에 대해 마술처럼 제어 가능한 애니메이션을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.