Skip to main content
QUICK REVIEW

[논문 리뷰] Do Generative Models Know Disentanglement? Contrastive Learning is All You Need

Xuanchi Ren, Tao Yang|arXiv (Cornell University)|2021. 02. 21.
Generative Adversarial Networks and Image Synthesis참고 문헌 32인용 수 9
한 줄 요약

이 논문은 사전 훈련된 생성 모델(GAN, VAE, 플로우)에서 명시적 분리 정규화 없이도 분리된 표현을 발견할 수 있는 모델에 종속되지 않고 비지도 학습 방법인 Disentanglement via Contrast (DisCo)를 제안한다. 네비게이터를 통해 잠재 공간의 방향을 탐색하고, 변동 공간에서 차이 연산자를 사용하는 대비 인코더를 통해 대비 학습과 엔트로피 기반 지배 손실을 통해 최신 기술 성능을 달성한다.

ABSTRACT

Disentangled generative models are typically trained with an extra regularization term, which encourages the traversal of each latent factor to make a distinct and independent change at the cost of generation quality. When traversing the latent space of generative models trained without the disentanglement term, the generated samples show semantically meaningful change, raising the question: do generative models know disentanglement? We propose an unsupervised and model-agnostic method: Disentanglement via Contrast (DisCo) in the Variation Space. DisCo consists of: (i) a Navigator providing traversal directions in the latent space, and (ii) a $\Delta$-Contrastor composed of two shared-weight Encoders, which encode image pairs along these directions to disentangled representations respectively, and a difference operator to map the encoded representations to the Variation Space. We propose two more key techniques for DisCo: entropy-based domination loss to make the encoded representations more disentangled and the strategy of flipping hard negatives to address directions with the same semantic meaning. By optimizing the Navigator to discover disentangled directions in the latent space and Encoders to extract disentangled representations from images with Contrastive Learning, DisCo achieves the state-of-the-art disentanglement given pretrained non-disentangled generative models, including GAN, VAE, and Flow. Project page at this https URL.

연구 동기 및 목표

  • 사전 훈련된 생성 모델이 명시적 분리 정규화 없이도 본질적으로 분리된 표현을 갖는지 조사하는 것.
  • 기본적인 분리 정규화 항으로 인해 발생하는 분리도와 생성 품질 간의 상충 관계를 해결하는 것.
  • 비지도 학습 방법을 통해 분리되지 않은 생성 모델의 잠재 공간에서 분리된 방향을 발견하는 모델에 종속되지 않은 방법을 개발하는 것.
  • 지표 인식 정보가 없는 상태에서 대비 학습을 통해 분리도 성능을 향상시키는 것.
  • 유사한 의미를 가진 하드 음성 요소를 식별하고 뒤집음으로써 탐색 방향의 의미 모호성을 줄이는 것.

제안 방법

  • 네비게이터 모듈은 잠재 공간을 탐색하여 탐색 방향을 생성하고, 의미 있는 의미 변화를 식별한다.
  • Δ-대비기구는 두 개의 공유 가중치 인코더를 사용하여 탐색 방향을 따라 이미지 쌍을 분리된 표현으로 인코딩한다.
  • 차이 연산자는 인코딩된 표현을 변동 공간으로 매핑하여 의미 변화에 대한 대비 학습을 가능하게 한다.
  • 엔트로피 기반 지배 손실은 표현의 다양성과 독립성을 증진시켜 인코딩된 표현이 더 분리되도록 유도한다.
  • 하드 음성 뒤집기 전략은 의미적으로 유사한 변화가 있는 방향을 식별하고 뒤집음으로써 정확도를 향상시킨다.
  • 이 방법은 종단 간 대비 학습 목표를 사용하여 지도 없이도 분리도를 발견할 수 있도록 훈련된다.

실험 결과

연구 질문

  • RQ1GAN, VAE, 플로우와 같은 사전 훈련된 생성 모델이 명시적 분리 정규화 없이도 본질적으로 분리된 표현을 학습할 수 있는가?
  • RQ2비분리된 모델의 잠재 공간에서 변동 공간에서의 대비 학습이 효과적으로 분리된 방향을 발견할 수 있는가?
  • RQ3엔트로피 기반 지배 손실은 표준 대비 목표 함수에 비해 분리도 품질을 어떻게 향상시키는가?
  • RQ4하드 음성 뒤집기 전략이 학습된 탐색 방향의 의미적 독립성을 얼마나 향상시키는가?
  • RQ5DisCo는 재훈련 없이도 다양한 생성 모델에서 최신 기술 성능을 달성하는가?

주요 결과

  • DisCo는 GAN, VAE, 정규화 플로우와 같은 사전 훈련된 분리되지 않은 생성 모델만을 사용하여 벤치마크 데이터셋에서 최신 기술 성능을 달성한다.
  • 이 방법은 지도나 아키텍처 수정 없이도 잠재 공간에서 의미적으로 의미 있고 독립적인 분리된 요소를 성공적으로 발견한다.
  • 엔트로피 기반 지배 손실은 표현의 다양성과 독립성을 증진시켜 분리도 품질을 크게 향상시킨다.
  • 하드 음성 뒤집기 전략은 탐색 방향의 의미 모호성을 효과적으로 줄여 학습된 요소의 독립성을 향상시킨다.
  • DisCo는 모델에 종속되지 않으며 다양한 생성 모델 아키텍처에서 작동하여 광범위한 적용 가능성을 보여준다.
  • 이 방법은 재훈련 없이도 높은 분리도 점수를 달성하면서 생성 품질을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.