Skip to main content
QUICK REVIEW

[논문 리뷰] Autoregressive Image Generation using Residual Quantization

Doyup Lee, Chiheon Kim|arXiv (Cornell University)|2022. 03. 03.
Advanced Vision and Imaging인용 수 8
한 줄 요약

이 논문은 잔차 양자화를 사용한 고해상도 순차적 이미지 생성을 위한 이단계 프레임워크인 RQ-VAE와 RQ-Transformer를 제안한다. 고정 크기의 코드북을 사용한 군집에서 세분화된 잔차 양자화를 통해 RQ-VAE는 256×256 이미지를 8×8×4 코드 맵으로 압축하여, RQ-Transformer가 이전 순차적 모델들보다 훨씬 낮은 계산 비용과 더 빠른 추론 속도로 고해상도 이미지를 생성할 수 있도록 한다.

ABSTRACT

For autoregressive (AR) modeling of high-resolution images, vector quantization (VQ) represents an image as a sequence of discrete codes. A short sequence length is important for an AR model to reduce its computational costs to consider long-range interactions of codes. However, we postulate that previous VQ cannot shorten the code sequence and generate high-fidelity images together in terms of the rate-distortion trade-off. In this study, we propose the two-stage framework, which consists of Residual-Quantized VAE (RQ-VAE) and RQ-Transformer, to effectively generate high-resolution images. Given a fixed codebook size, RQ-VAE can precisely approximate a feature map of an image and represent the image as a stacked map of discrete codes. Then, RQ-Transformer learns to predict the quantized feature vector at the next position by predicting the next stack of codes. Thanks to the precise approximation of RQ-VAE, we can represent a 256$ imes$256 image as 8$ imes$8 resolution of the feature map, and RQ-Transformer can efficiently reduce the computational costs. Consequently, our framework outperforms the existing AR models on various benchmarks of unconditional and conditional image generation. Our approach also has a significantly faster sampling speed than previous AR models to generate high-quality images.

연구 동기 및 목표

  • 계산 효율성 향상을 위해 코드 시퀀스 길이를 줄이는 것이 핵심이지만, 이전 VQ 방법들이 이미지 품질을 유지하지 못하는 순차적 이미지 생성의 비율-왜곡 트레이드오프 문제를 해결하기 위해.
  • 특징 맵의 정밀한 근사로 인해 이산 코드의 시퀀스 길이를 최소화함으로써 계산 비용을 줄이고 고해상도 이미지 생성을 가능하게 하기 위해.
  • 부드러운 레이블링과 확률적 샘플링 기법을 도입하여 노출 오차를 해결하고 순차적 모델의 훈련 안정성과 성능을 향상시키기 위해.
  • 기존 순차적 모델들과 비교해 이미지 품질을 유지하거나 향상시키면서도 더 빠른 추론 속도를 달성하기 위해.

제안 방법

  • RQ-VAE는 고정 크기의 코드북을 사용한 잔차 양자화를 통해 군집에서 세분화된 방식으로 특징 맵 근사치를 반복적으로 개선하며, 이미지를 스택된 이산 코드로 표현한다.
  • 이 모델은 4단계의 잔차 양자화를 적용하여 256×256 이미지의 공간 해상도를 8×8로 감소시키며, 코드북 크기를 늘리지 않아도 고해상도 재구성 품질을 유지한다.
  • RQ-Transformer는 스택된 코드들을 시퀀스로 간주하고 각 위치에서 다음 코드 스택을 순차적으로 예측하며, 짧아진 시퀀스 길이 덕분에 효율성을 확보한다.
  • 노출 오차를 완화하고 일반화 성능을 향상시키기 위해 RQ-Transformer 훈련 중에 부드러운 레이블링과 확률적 샘플링 기법을 도입한다.
  • 순차적 모델링을 위해 3차원 코드 맵을 래스터 스캔 순서로 1차원 시퀀스로 변환한다.
  • 재구성 품질은 rFID를, 생성 품질은 ImageNet과 LSUN을 포함한 벤치마크에서 FID와 Inception Score로 평가한다.

실험 결과

연구 질문

  • RQ1고정 크기의 코드북을 사용한 잔차 양자화가 고해상도 이미지 생성에서 표준 VQ-VAE보다 더 높은 재구성 품질과 더 낮은 해상도를 달성할 수 있는가?
  • RQ2RQ-VAE를 통해 코드 시퀀스 길이를 단축시켜도 이미지 품질을 훼손하지 않고 더 빠르고 효율적인 순차적 모델링이 가능한가?
  • RQ3부드러운 레이블링과 확률적 샘플링이 노출 오차를 줄여 RQ-Transformer의 성능 향상에 얼마나 기여하는가?
  • RQ4제안된 프레임워크는 조건부 및 비조건부 이미지 생성 과제에서 기존 순차적 모델들과 비교해 FID, Inception Score 및 추론 속도 측면에서 어떻게 성과를 내는가?

주요 결과

  • 코드북 크기 K=16,384, 8×8×4 코드 맵을 사용한 RQ-VAE는 공간 해상도가 4배 감소했음에도 불구하고, 16×16 맵을 사용한 VQ-GAN보다 훨씬 높은 재구성 품질(rFID=10.2)을 달성한다.
  • 고정된 K=16,384에서 양자화 깊이 D를 1에서 4로 증가시킬 경우 rFID가 3.1점 향상되어 13.3에서 10.2로 향상되며, 코드북 크기를 늘리는 것보다 잔차 양자화의 효과가 뛰어나다는 것을 입증한다.
  • RQ-Transformer는 ImageNet 256×256 비조건부 생성에서 최신 기준 FID 점수 10.2를 기록하여 이전 순차적 모델들을 능가한다.
  • LSUN, FFHQ, CC-3M 벤치마크에서 이전 순차적 모델들보다 2.5배 더 빠른 추론 속도를 달성하면서도 이미지 품질을 유지하거나 향상시켰다.
  • 시각화 결과는 RQ-VAE가 군집에서 세분화된 방식으로 재구성한다는 것을 확인한다: 더 깊은 양자화 수준일수록 점점 더 세밀한 이미지 세부 정보를 추가하며, 낮은 노름 코드 임베딩이 더 깊은 단계에서 사용된다.
  • 코드 사용 분포 분석 결과, 깊이 수준 간에 상당한 중복이 관찰되어 공유 코드북의 효율적 재사용과 효과적인 활용이 이루어졌음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.