Skip to main content
QUICK REVIEW

[논문 리뷰] MoVQ: Modulating Quantized Vectors for High-Fidelity Image Generation

Chuanxia Zheng, Long Vuong|arXiv (Cornell University)|2022. 09. 19.
Generative Adversarial Networks and Image Synthesis인용 수 14
한 줄 요약

MoVQ는 공간적으로 조건화된 정규화를 도입하여 양자화된 벡터에 공간적으로 변동하는 정보를 통합함으로써 반복적인 아티팩트를 감소시키고 고해상도 이미지 생성을 향상시키는 모odulated VQGAN 프레임워크를 제안한다. 또한 다중채널 잠재 코드를 통해 표현력을 향상시키고, MaskGIT을 활용해 계산 비용 증가 없이도 빠른 사전 모델링을 구현함으로써, 추론 비용 증가 없이 최신 기준 FID 점수(Imagenet 기준 1.05, FFHQ 기준 2.26)를 달성한다.

ABSTRACT

Although two-stage Vector Quantized (VQ) generative models allow for synthesizing high-fidelity and high-resolution images, their quantization operator encodes similar patches within an image into the same index, resulting in a repeated artifact for similar adjacent regions using existing decoder architectures. To address this issue, we propose to incorporate the spatially conditional normalization to modulate the quantized vectors so as to insert spatially variant information to the embedded index maps, encouraging the decoder to generate more photorealistic images. Moreover, we use multichannel quantization to increase the recombination capability of the discrete codes without increasing the cost of model and codebook. Additionally, to generate discrete tokens at the second stage, we adopt a Masked Generative Image Transformer (MaskGIT) to learn an underlying prior distribution in the compressed latent space, which is much faster than the conventional autoregressive model. Experiments on two benchmark datasets demonstrate that our proposed modulated VQGAN is able to greatly improve the reconstructed image quality as well as provide high-fidelity image generation.

연구 동기 및 목표

  • 양자화 과정에서 유사한 패치들이 동일한 코드로 축소되면서 발생하는 반복적인 아티팩트 패턴을 해결하기 위함.
  • 모델 복잡성이나 계산 비용을 증가시키지 않으면서도 이미지 재구성 및 생성 품질을 향상시키기 위함.
  • 이산 공간 내에서 다중채널 잠재 벡터를 통해 코드북 활용도와 표현 능력을 향상시키기 위함.
  • 압축된 잠재 공간에서 효율적인 순차적 생성을 위한 자동회귀적 생성을 가능하게 하기 위해 MaskGIT을 활용해 두 번째 단계 사전 모델링을 가속화하기 위함.

제안 방법

  • 양자화된 벡터를 사용해 디코더 활성화를 조절하는 공간적으로 조건화된 정규화를 도입하여, 공간적으로 변동하는 맥락을 통합한다.
  • 코드북 크기를 유지하면서도 이산 코드의 재조합 능력을 높이기 위해 다중채널 표현을 활용한다.
  • 정규화 모듈의 초기 공간 임베딩으로 푸리에 특징을 사용하며, 위치 임베딩이나 학습 가능한 상수보다 뛰어난 성능을 보인다.
  • 잠재 공간 내 이산 토큰의 사전 분포를 모델링하기 위해 MaskGIT을 도입하여, 신뢰도 기반의 빠른 토큰 예측을 가능하게 한다.
  • 기존 VQGAN 인코더-디코더 아키텍처를 유지하면서도, 조절 가능한 정규화와 다중채널 잠재 맵을 통합하여 향상시킨다.
  • 채널 간 공유 코드북을 유지함으로써 효율성을 확보하면서도 표현 정밀도를 향상시킨다.

실험 결과

연구 질문

  • RQ1공간적으로 조건화된 정규화를 통해 이산 코드에 공간적으로 변동하는 정보를 통합함으로써, VQ 기반 이미지 생성에서 반복적인 아티팩트를 줄일 수 있는가?
  • RQ2모델 복잡성 증가 없이도 다중채널 잠재 표현이 이미지 재구성 및 생성 품질을 향상시킬 수 있는가?
  • RQ3정규화 모듈에서 푸리에 기반 공간 임베딩이 위치 또는 학습 가능한 상수 임베딩보다 우월한 성능을 보일 수 있는가?
  • RQ4동일한 압축 비율 조건에서 MoVQ는 최신 기준 VQ 기반 모델 대비 FID 점수와 재구성 품질 측면에서 어떻게 비교되는가?
  • RQ5MaskGIT을 통해 이산 잠재 공간에서의 사전 모델링을 효과적으로 가속화할 수 있으며, 고해상도 생성 품질을 유지할 수 있는가?

주요 결과

  • MoVQ는 ImageNet에서 Fréchet Inception Distance(FID) 1.05, FFHQ에서 2.26를 기록하여 기준 VQGAN 및 최신 기준 모델을 크게 능가한다.
  • 공간적으로 조건화된 정규화에서 푸리에 특징을 사용할 경우 가장 뛰어난 성능을 보였으며, 위치 임베딩 대비 FID 점수를 1.5점 이상 감소시켰다.
  • 코드북 항목 수가 1024개에 불과한 상황에서도 표준 VQGAN의 더 큰 코드북보다 뛰어난 성능을 기록하여 코드북 효율성이 향상됨을 시사한다.
  • 4채널 다중채널 표현을 통해 FID는 11.4에서 10.6으로 감소하여 표현 능력 향상이 확인되었다.
  • 작은 코드북을 사용함에도 불구하고 높은 재구성 품질을 유지하고 다양하고 고해상도의 이미지를 생성할 수 있었다.
  • MoVQ에서는 코드북 사용률이 크게 향상되어, 표준 VQ 기반 모델 대비 이산 코드의 활용도가 향상됨을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.