Skip to main content
QUICK REVIEW

[논문 리뷰] Conditional Adversarial Generative Flow for Controllable Image Synthesis

Rui Liu, Yu Liu|arXiv (Cornell University)|2019. 04. 03.
Generative Adversarial Networks and Image Synthesis참고 문헌 41인용 수 6
한 줄 요약

이 논문은 조건부 입력(예: 정체성, 속성)을 가역적 흐름의 잠재 공간으로 매핑하기 위해 적대적 인코더를 사용하는 새로운 흐름 기반 생성 모델인 조건부 적대적 생성 흐름(CAGlow)을 제안한다. 이는 제어 가능한 고해상도 이미지 생성을 가능하게 한다. CAGlow는 복잡하거나 알려지지 않은 조건 하에서도 표준 Glow보다 우수한 성능을 보이며, 더 나은 속성 분리도와 낮은 분포 차이를 달성함으로써 조건부 이미지 생성에서 뛰어난 성능을 발휘한다.

ABSTRACT

Flow-based generative models show great potential in image synthesis due to its reversible pipeline and exact log-likelihood target, yet it suffers from weak ability for conditional image synthesis, especially for multi-label or unaware conditions. This is because the potential distribution of image conditions is hard to measure precisely from its latent variable $z$. In this paper, based on modeling a joint probabilistic density of an image and its conditions, we propose a novel flow-based generative model named conditional adversarial generative flow (CAGlow). Instead of disentangling attributes from latent space, we blaze a new trail for learning an encoder to estimate the mapping from condition space to latent space in an adversarial manner. Given a specific condition $c$, CAGlow can encode it to a sampled $z$, and then enable robust conditional image synthesis in complex situations like combining person identity with multiple attributes. The proposed CAGlow can be implemented in both supervised and unsupervised manners, thus can synthesize images with conditional information like categories, attributes, and even some unknown properties. Extensive experiments show that CAGlow ensures the independence of different conditions and outperforms regular Glow to a significant extent.

연구 동기 및 목표

  • 다중 레이블 또는 알려지지 않은 조건에서 흐름 기반 모델의 조건부 이미지 생성 능력에 한계가 존재하는 문제를 해결한다.
  • 복잡한 이미지 조건에 대해 정확한 잠재 분포 추정이 어려운 문제를 해결한다.
  • 감독 및 비감독 조건 학습을 모두 활용하여 강건하고 분리된 조건부 이미지 생성을 가능하게 한다.
  • 복잡한 조건 하에서도 생성 샘플의 품질과 실제 이미지 및 생성 이미지 간의 분포 일치도를 향상시킨다.

제안 방법

  • 가역적 흐름의 잠재 공간으로 조건 공간을 매핑하기 위한 학습 가능한 인코더를 통합한 조건부 흐름 기반 모델인 CAGlow를 제안한다.
  • 주어진 조건 하에서 생성된 잠재 코드가 실제 데이터 분포와 일치하도록 인코더를 적대적으로 학습시킨다.
  • 이미지와 조건의 공동 확률 밀도 모델링을 통해 정확한 로그우도와 적대적 정규화를 동시에 구현하는 엔드 투 엔드 학습을 가능하게 한다.
  • 감독 없이도 잠재 코드 조작을 통해 해석 가능한 알려지지 않은 성질(예: 회전, 밝기)을 비감독적으로 발견할 수 있도록 한다.
  • 지식 있는 레이블 또는 잠재 요인에 기반한 조건부 생성을 허용하는 감독 및 비감독 학습 모드를 모두 구현한다.
  • 흐름의 가역성을 활용하여 특정 조건에 해당하는 잠재 코드를 조작함으로써 제어 가능한 이미지 생성을 실현한다.

실험 결과

연구 질문

  • RQ1조건이 복잡하거나 다중 모달일 경우 흐름 기반 생성 모델이 고품질의 조건부 이미지 생성을 달성할 수 있는가?
  • RQ2적대적 인코더가 흐름 기반 프레임워크 내에서 조건 공간에서 잠재 공간으로의 연속적이고 분리된 매핑을 효과적으로 학습할 수 있는가?
  • RQ3CAGlow는 비감독적으로 알려지지 않은 해석 가능한 이미지 성질을 발견하고 조작할 수 있는가?
  • RQ4복잡한 조건 하에서 CAGlow는 표준 Glow에 비해 속성 안정성, FID 점수, 분포 일치도 측면에서 어떻게 비교되는가?

주요 결과

  • CAGlow는 CelebA 데이터셋에서 생성된 이미지의 속성 분류 정확도가 93.75%로, CGlow(87.36%)보다 뚜렷이 높게 기록되었다.
  • CAGlow의 속성 평균 확률(AMP)의 분산은 0.0016으로, CGlow의 0.0245보다 훨씬 낮아 더 뛰어난 속성 안정성을 나타낸다.
  • CAGlow는 조건 조작 시 AMP의 절대 차이를 CGlow 대비 최대 80% 감소시켜 더 나은 분리도를 입증했다.
  • MNIST에서는 CAGlow가 잠재 코드의 변형을 통해 숫자의 회전 및 폭과 같은 알려지지 않은 성질을 성공적으로 학습하고 조작함으로써 비감독적 해석 가능성의 가능성을 입증했다.
  • CelebA에서 CAGlow는 명시적으로 주석이 달리지 않은 자세 각도와 밝기 변화를 포착함으로써, 비감독적으로 해석 가능한 요소를 발견했음을 확인했다.
  • CAGlow는 조건부 제어에도 불구하고 원래 Glow 수준의 낮은 FID 점수를 유지하여 생성 이미지의 높은 다양성과 정확성을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.