[논문 리뷰] Unsupervised Discovery of Disentangled Manifolds in GANs
이 논문은 사전 훈련된 GAN의 잠재 공간에서 분리 가능하고 해석 가능한 방향을 비지도 학습으로 발견하기 위한 프레임워크를 제안한다. 이는 한-hot 속성 벡터에서 잠재 코드로의 변환을 학습하고, 부드럽고 일관된 성질을 향상시키기 위해 중심점 손실을 적용함으로써 이루어진다. 이 방법은 다양한 데이터셋과 모델에서 더 나은 시각적 경로 길이와 재구성 정확도를 확보하면서도, 제어 가능한 속성 기반 이미지 편집을 가능하게 한다.
As recent generative models can generate photo-realistic images, people seek to understand the mechanism behind the generation process. Interpretable generation process is beneficial to various image editing applications. In this work, we propose a framework to discover interpretable directions in the latent space given arbitrary pre-trained generative adversarial networks. We propose to learn the transformation from prior one-hot vectors representing different attributes to the latent space used by pre-trained models. Furthermore, we apply a centroid loss function to improve consistency and smoothness while traversing through different directions. We demonstrate the efficacy of the proposed framework on a wide range of datasets. The discovered direction vectors are shown to be visually corresponding to various distinct attributes and thus enable attribute editing.
연구 동기 및 목표
- 사전 훈련된 GAN의 잠재 공간에서 제어 가능한 이미지 편집을 위해 비지도로 분리 가능하고 해석 가능한 방향을 발견하는 것.
- 재훈련이나 감독 없이도 GAN의 잠재 공간에서 일관되고 부드러운 속성 조작이 어려운 문제를 해결하는 것.
- 새로운 중심점 기반 정규화를 통해 발견된 방향을 따라 이미지 전환의 일관성과 부드러움을 향상시키는 것.
- 다양한 데이터셋(Anime Faces, ILSVRC-ImageNet, FFHQ)과 사전 훈련된 모델(SNGAN, BigGAN, StyleGAN2)을 통해 방법의 유효성을 검증하는 것.
제안 방법
- 원본 이미지와 두 개의 이격된 이미지(연속적인 잠재 벡터 덧셈으로 생성)로부터 잠재 코드 이동의 방향과 크기를 예측하는 변형망 $A$를 훈련한다.
- 재구성망 $R$을 사용하여 원본 이미지와 이격된 이미지로부터 속성 레이블 $k$와 이동 크기 $\varepsilon$를 예측함으로써 엔드 투 엔드 훈련을 가능하게 한다.
- 동일한 속성 방향 $k$에 속하는 모든 이격된 잠재 코드가 그 방향에 대응하는 학습된 중심점에 가까워지도록 유도하는 중심점 손실을 도입한다.
- 잠재 공간에 이격된 코드를 추가함으로써 사전 훈련된 생성기(예: StyleGAN2의 $W$-스페이스)에 프레임워크를 적용하여 재훈련 없이도 속성 기반 편집을 가능하게 한다.
- 대비 학습과 중심점 정규화를 함께 사용하여 변형망과 재구성망을 동시에 훈련함으로써 분리 가능성과 일관성을 향상시킨다.
- 이미지 생성 과정을 두 단계로 나누어, 먼저 $z$에서 $z + A(k_1, \varepsilon_1)$로 이동하고, 그 다음에 $z + A(k_1, \varepsilon_1) + A(k_2, \varepsilon_2)$로 이동함으로써 다중 속성 전이를 가능하게 한다.
실험 결과
연구 질문
- RQ1재훈련이나 감독 없이도 사전 훈련된 GAN의 잠재 공간에서 분리 가능하고 해석 가능한 방향을 발견할 수 있는가?
- RQ2이미지 생성 과정에서 잠재 공간의 속성 전이가 얼마나 부드럽고 일관성 있게 이루어지는가?
- RQ3중심점 손실을 도입함으로써 동일한 속성에 해당하는 잠재 코드의 군집화가 향상되어 편집 가능성은 향상되는가?
- RQ4제안된 방법은 다양한 데이터셋(예: FFHQ, ILSVRC-ImageNet, Anime Faces)과 다양한 사전 훈련된 GAN 아키텍처(BigGAN, StyleGAN2, SNGAN)에 일반화되는가?
- RQ5기본 비지도 GAN 분리 가능성 방법에 비해, 본 방법은 시각적 품질과 분리 가능성 측면에서 얼마나 향상되는가?
주요 결과
- BigGAN-FFHQ에서 제안된 방법은 Perceptual Path Length(PPL)가 99.78로 기준값(179.23)보다 유의미하게 낮아, 더 부드럽고 시각적으로 일관된 이미지 전이를 나타낸다.
- BigGAN을 사용한 ILSVRC-ImageNet 데이터셋에서, 본 방법은 Reconstructor Classification Accuracy(RCA)가 0.85를 기록하여 기준값(0.84)과 중심점 손실 제거한 아블레이션(0.86)을 초월하며 분리 가능성 향상을 입증한다.
- StyleGAN2를 사용한 FFHQ에서 본 방법은 PPL이 402.64이고 RCA가 0.82로, 고해상도이고 복잡한 얼굴 생성 환경에서도 일관된 성능을 보였다.
- 중심점 손실은 잠재 코드의 내부 클래스 분산을 효과적으로 줄였으며, 이는 더 낮은 PPL 값과 다수의 시도에서 일관된 속성 변화를 통해 뒷받침된다.
- 정성적 결과에서는 헤어 컬러, 헤어 스타일, 안경과 같은 다양한 의미 있는 속성을 성공적으로 발견하였고, 방향 간 전이가 부드럽게 이루어지는 것으로 나타났다.
- Anime Faces, ILSVRC-ImageNet, FFHQ에서의 양적 지표와 시각적 품질에서의 일관된 향상으로 인해, 본 방법은 다양한 GAN 아키텍처와 데이터셋에 일반화됨을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.