Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Disentangled Representation by Exploiting Pretrained Generative Models: A Contrastive Learning View

Xuanchi Ren, Tao Yang|arXiv (Cornell University)|2021. 02. 21.
Generative Adversarial Networks and Image Synthesis인용 수 13
한 줄 요약

이 논문은 사전 훈련된 생성 모델(GAN, VAE, Flow)을 활용하여 생성 품질과 분리성 간의 트레이드오프 없이 잠재 공간에서의 분리된 방향을 동시에 탐색하고 분리된 표현을 학습하는 대비 학습 프레임워크인 DisCo를 제안한다. 새로운 Δ-대비기(Contrastor)를 통해 이미지의 변형을 모델링하고, 엔트로피 기반의 지배 손실을 적용함으로써 DisCo는 여러 벤치마크 데이터셋과 실제 FFHQ 데이터에서 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

From the intuitive notion of disentanglement, the image variations corresponding to different factors should be distinct from each other, and the disentangled representation should reflect those variations with separate dimensions. To discover the factors and learn disentangled representation, previous methods typically leverage an extra regularization term when learning to generate realistic images. However, the term usually results in a trade-off between disentanglement and generation quality. For the generative models pretrained without any disentanglement term, the generated images show semantically meaningful variations when traversing along different directions in the latent space. Based on this observation, we argue that it is possible to mitigate the trade-off by $(i)$ leveraging the pretrained generative models with high generation quality, $(ii)$ focusing on discovering the traversal directions as factors for disentangled representation learning. To achieve this, we propose Disentaglement via Contrast (DisCo) as a framework to model the variations based on the target disentangled representations, and contrast the variations to jointly discover disentangled directions and learn disentangled representations. DisCo achieves the state-of-the-art disentangled representation learning and distinct direction discovering, given pretrained non-disentangled generative models including GAN, VAE, and Flow. Source code is at https://github.com/xrenaa/DisCo.

연구 동기 및 목표

  • 비지도 표현 학습에서 분리성과 생성 품질 간의 트레이드오프를 해결하기 위해.
  • 재훈련 없이도 사전 훈련된 비분리 생성 모델만을 사용하여 분리된 표현 학습을 가능하게 하기 위해.
  • 사전 훈련된 모델의 잠재 공간에서 의미적으로 해석 가능한 요소를 탐지하기 위해.
  • 재훈련이 필요 없고 다양한 생성 모델에 적용 가능한 통합형, 모델에 종속되지 않는 분리 프레임워크를 개발하기 위해.
  • 대비 학습을 통해 이미지의 변형을 모델링하고 잠재 공간에서의 분리된 방향을 식별하기 위해.

제안 방법

  • DisCo는 고정된 사전 훈련된 생성기와 함께, 발견된 잠재 방향을 따라 이미지 변형을 대비함으로써 인코더를 훈련시켜 분리된 표현을 학습한다.
  • 이 프레임워크는 잠재 방향을 따라 생성된 이미지 쌍 간의 변형을 모델링하는 데 전용으로 설계된 새로운 Δ-대비기 모듈을 도입한다. 이는 이미지 수준의 특징에 대한 대비 학습을 가능하게 한다.
  • 요소 탐색을 위해 잠재 공간에서 후보 트래버스 방향을 생성하는 내비게이터 모듈을 사용한다.
  • 잠재 코드의 다양성을 증진시켜 표현이 더 분리되도록 유도하기 위해 엔트로피 기반의 지배 손실을 적용한다.
  • 대비 손실 최적화를 향상시키기 위해 동적으로 어려운 음성 샘플을 선택하는 하드 음성 플립 전략을 사용한다.
  • 이 방법은 사전 훈련된 생성기를 수정하지 않으며, GAN, VAE, 노멀라이징 플로우 등 다양한 모델에 적용 가능하다.

실험 결과

연구 질문

  • RQ1사전 훈련된 생성 모델의 생성 품질을 희생시키지 않고 최신 기술 수준의 분리된 표현 학습을 달성할 수 있는가?
  • RQ2비분리된 사전 훈련된 모델의 잠재 공간에서 의미적으로 해석 가능한 분리된 방향을 탐지할 수 있는가?
  • RQ3대비 학습을 어떻게 효과적으로 이미지의 변형에 적용하여 잠재 공간에서의 분리된 요소를 탐지할 수 있는가?
  • RQ4다양한 종류의 사전 훈련된 생성 모델에 대해 통합된 프레임워크를 설계하여 동시에 분리된 표현을 학습하고 잠재 방향을 탐지할 수 있는가?
  • RQ5명시적 정규화 없이 대비 학습 환경에서 분리성 성능을 향상시키는 데 핵심이 되는 구성 요소는 무엇인가?

주요 결과

  • DisCo는 dSprites, Cars3D, Chairs와 같은 세 가지 주요 벤치마크 데이터셋에서 모든 평가 지표에서 최신 기술 수준의 분리성 성능를 달성한다.
  • FFHQ 데이터셋에서 DisCo는 사전 훈련된 StyleGAN의 잠재 공간에서 고품질의 의미적으로 해석 가능한 분리된 방향을 성공적으로 탐지한다.
  • 엔트로피 기반의 지배 손실은 학습된 표현의 다양성을 증진시켜 분리성 향상에 크게 기여한다.
  • 하드 음성 플립 전략은 대비 학습 최적화를 향상시켜 더 강력하고 분리된 표현을 도출한다.
  • DisCo는 발견 기반 방법과 전통적인 VAE/InfoGAN 기반 접근 방식을 모두 초월하여 분리성 품질에서 뛰어난 성능을 보인다.
  • 사전 훈련된 생성기를 고정해 재학습하지 않기 때문에 높은 품질의 이미지 생성 품질을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.