Skip to main content
QUICK REVIEW

[논문 리뷰] PandA: Unsupervised Learning of Parts and Appearances in the Feature Maps of GANs

J. E. Oldfield, Christos Tzelepis|arXiv (Cornell University)|2022. 05. 31.
Generative Adversarial Networks and Image Synthesis인용 수 10
한 줄 요약

PandA는 사전 훈련된 GAN의 특징 맵에서 아키텍처에 관계없이 비지도 학습 방식으로 해석 가능한 부분과 외관 요소를 동시에 발견하는 아키텍처에 종속되지 않는 비지도 학습 방법을 제안한다. 이를 통해 감독 없이 맥락 인식이 가능한 픽셀 수준의 국소 이미지 편집이 가능하며, 기존 최고 수준의 방법들에 비해 훨씬 높은 정확도와 1/400분의 훈련 시간을 달성한다.

ABSTRACT

Recent advances in the understanding of Generative Adversarial Networks (GANs) have led to remarkable progress in visual editing and synthesis tasks, capitalizing on the rich semantics that are embedded in the latent spaces of pre-trained GANs. However, existing methods are often tailored to specific GAN architectures and are limited to either discovering global semantic directions that do not facilitate localized control, or require some form of supervision through manually provided regions or segmentation masks. In this light, we present an architecture-agnostic approach that jointly discovers factors representing spatial parts and their appearances in an entirely unsupervised fashion. These factors are obtained by applying a semi-nonnegative tensor factorization on the feature maps, which in turn enables context-aware local image editing with pixel-level control. In addition, we show that the discovered appearance factors correspond to saliency maps that localize concepts of interest, without using any labels. Experiments on a wide range of GAN architectures and datasets show that, in comparison to the state of the art, our method is far more efficient in terms of training time and, most importantly, provides much more accurate localized control. Our code is available at: https://github.com/james-oldfield/PandA.

연구 동기 및 목표

  • 감독 없이 일반적인 목적의, 아키텍처에 종속되지 않는 GAN 생성 이미지의 해석 및 편집 방법을 개발하는 것.
  • 사전 훈련된 GAN의 특징 맵에서 공간적 부분과 그 외관 요소를 비지도 방식으로 동시에 발견하는 것.
  • 수동으로 영역 주석이나 세그멘테이션 마스크에 의존하지 않고 정밀하고 맥락 인식이 가능한 픽셀 수준의 국소 이미지 편집을 가능하게 하는 것.
  • 기존의 기울기 기반 또는 최적화 중심의 접근 방식에 비해 훈련 시간을 크게 줄이는 것.
  • 어떤 레이블도 사용하지 않고 학습된 개념에 대한 중요도 맵을 식별하는 것.

제안 방법

  • 이 방법은 사전 훈련된 GAN에서 유도된 특징 맵 데이터셋 $\mathcal{Z} \in \mathbb{R}^{M \times H \times W \times C}$ 에 대해 반비음성 텐서 분해를 적용한다.
  • 제약 조건이 있는 최적화를 통해 특징 맵을 전역적 부분 요소와 외관 요소로 분해함으로써 분리된 표현 학습을 가능하게 한다.
  • 부분 요소는 고차원 특이값 분해(HOSVD)를 초기화하여 교차 최적화 방식으로 학습되며, 수렴성과 해석 가능성 향상에 기여한다.
  • 외관 요소는 재구성 손실에 대한 기울기 하강법을 통해 개선되어 주목성 있고 의미 있는 패턴과 대응된다.
  • 이 방법은 각 영역별로 비용이 많이 드는 야코비안 또는 기울기 계산을 피하고, 단일 효율적인 분해 단계에 의존한다.
  • 이 프레임워크는 아키텍처 수정 없이도 StyleGAN, ProgressiveGAN, BigGAN 등 다양한 GAN 아키텍처와 호환된다.

실험 결과

연구 질문

  • RQ1사람이 주석한 영역이나 세그멘테이션 마스크 없이도 GAN 특징 맵에서 해석 가능한 부분과 외관 요소를 발견할 수 있는가?
  • RQ2비지도 특징 맵 분해만으로도 픽셀 수준의 국소 이미지 편집을 위한 정밀한 제어를 달성할 수 있는가?
  • RQ3기존의 반복적 최적화 또는 기울기 계산이 필요한 최고 수준의 방법들에 비해 제안된 방법이 훈련 시간을 크게 줄일 수 있는가?
  • RQ4학습된 개념에 대해 레이블 없이도 발견된 외관 요소가 의미 있는 중요도 맵을 나타내는가?
  • RQ5특정 아키텍처에 맞게 튜닝하지 않고도 다양한 GAN 아키텍처 간에 일반화 가능한가?

주요 결과

  • PandA는 LowRankGAN에 비해 훈련 시간을 1/400 미만, StyleSpace에 비해 1/170 미만으로 줄여 뚜렷한 효율성 향상을 보였다.
  • 이 방법은 수동 영역 주석이 필요 없이도 SOTA 방법보다 더 정확한 국소 이미지 편집을 달성했다.
  • PandA가 발견한 외관 요소는 '배경'이나 '피부'와 같은 개념에 대해 레이블 없이도 의미 있는 중요도 맵을 나타내었다.
  • 다양한 랭크와 훈련 반복 횟수 동안 부분 요소는 안정적이고 의미적으로 해석 가능한 상태를 유지하여 강건성을 입증했다.
  • 이 방법은 StyleGAN1, StyleGAN2, StyleGAN3, ProgressiveGAN 등 테스트된 모든 GAN 아키텍처에서 공통적인 개념인 '배경'을 성공적으로 발견했다.
  • HOSVD 초기화를 사용함으로써 수렴성이 향상되고, SVD 기반 대안 대비 더 해석 가능한 초기 요소를 도출할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.