[논문 리뷰] Unleashing Transformers: Parallel Token Prediction with Discrete Absorbing Diffusion for Fast High-Resolution Image Generation from Vector-Quantized Codes
이 논문은 고해상도 이미지 생성을 위한 빠른 속도를 달성하기 위해 Transformer 기반 아키텍처를 사용하여 Vector-Quantized(VQ) 토큰을 병렬적으로 예측하는 비자기적(non-autoregressive) 확산 모델을 제안한다. 무작위로 VQ 토큰을 마스킹하고 단일 Transformer를 사용해 이를 재구성하도록 훈련시킴으로써, 훈련 데이터를 초월하는 해상도에서도 전역적으로 일관된 이미지 합성을 가능하게 하며, 계산 비용을 감소시키면서도 최신 기준(FID, Density, Coverage) 점수를 달성한다.
Whilst diffusion probabilistic models can generate high quality image content, key limitations remain in terms of both generating high-resolution imagery and their associated high computational requirements. Recent Vector-Quantized image models have overcome this limitation of image resolution but are prohibitively slow and unidirectional as they generate tokens via element-wise autoregressive sampling from the prior. By contrast, in this paper we propose a novel discrete diffusion probabilistic model prior which enables parallel prediction of Vector-Quantized tokens by using an unconstrained Transformer architecture as the backbone. During training, tokens are randomly masked in an order-agnostic manner and the Transformer learns to predict the original tokens. This parallelism of Vector-Quantized token prediction in turn facilitates unconditional generation of globally consistent high-resolution and diverse imagery at a fraction of the computational expense. In this manner, we can generate image resolutions exceeding that of the original training set samples whilst additionally provisioning per-image likelihood estimates (in a departure from generative adversarial approaches). Our approach achieves state-of-the-art results in terms of Density (LSUN Bedroom: 1.51; LSUN Churches: 1.12; FFHQ: 1.20) and Coverage (LSUN Bedroom: 0.83; LSUN Churches: 0.73; FFHQ: 0.80), and performs competitively on FID (LSUN Bedroom: 3.64; LSUN Churches: 4.07; FFHQ: 6.11) whilst offering advantages in terms of both computation and reduced training set requirements.
연구 동기 및 목표
- 고해상도 이미지 생성을 위한 자기적(VQ-VAE) 모델의 느린 순차적 추론 문제를 해결하기 위해.
- 순서에 민감하지 않은 비자기적 트랜스포머 아키텍처를 사용해 VQ 토큰을 병렬로 예측함으로써 순서 편향을 피하기 위해.
- 맥락 윈도우 집계를 통해 훈련 데이터 해상도를 초월하는 전역 일관성 있는 고해상도 이미지를 생성하기 위해.
- likelihood 기반 평가 지표(Density, Coverage)와 FID에서 최신 기준 성능을 달성하면서도 훈련 및 계산 비용을 감소시키기 위해.
- GAN 기반 방법과 달리 각 이미지의 likelihood 추정치를 제공함으로써 평가 향상과 조건부 생성 가능성 향상을 위해.
제안 방법
- 훈련 중 비자기적이고 순서에 민감하지 않은 방식으로 VQ 토큰을 점차 마스킹하는 이산 흡수 확산 과정을 사용한다.
- 단일 비자기적 트랜스포머를 사용해 마스킹된 버전으로부터 원본 VQ 토큰을 재구성하도록 훈련시켜 병렬 예측을 가능하게 한다.
- 모델은 전체 VQ 토큰 시퀀스를 병렬로 예측하도록 엔드 투 엔드로 훈련되며, 자기주의(self-attention)를 활용해 전역적 맥락을 활용한다.
- 추론 시, 완전히 마스킹된 상태에서 노이즈 제거를 수행하며, 다중 맥락 윈도우 집계를 통해 고해상도 이미지를 생성한다.
- 이 방법은 무조건적 및 조건부 생성을 지원하며, 타겟 마스킹 및 노이즈 제거를 통한 국소적 이미지 편집도 가능하다.
- 단일 트랜스포머 백본을 사용해 모든 확산 단계를 동시에 최적화함으로써, 단계별 자기적 확산 대비 파rameter 수와 추론 시간을 감소시킨다.
실험 결과
연구 질문
- RQ1비자기적이고 병렬적인 VQ 토큰 예측 메커니즘이 자기적 모델 대비 속도와 해상도에서 우월한 성능을 낼 수 있는가?
- RQ2단일 트랜스포머 모델이 무작위로 마스킹된 순서에 민감하지 않은 입력에서 VQ 토큰을 효과적으로 재구성하여 고품질의 이미지 생성을 가능하게 할 수 있는가?
- RQ3모델은 원래 훈련 데이터 해상도를 초월하는 이미지를 전역 일관성을 유지하면서 생성할 수 있는가?
- RQ4제안된 방법이 FID와 함께 likelihood 기반 평가 지표(Density, Coverage)에서 최신 기준 성능을 달성하면서도 훈련 및 추론 비용을 감소시킬 수 있는가?
- RQ5모델은 GAN 기반 접근 방식과 달리 국소적 이미지 편집과 각 이미지의 likelihood 추정치를 지원할 수 있는가?
주요 결과
- LSUN Bedroom에서 최신 기준인 1.51의 Density 점수를 달성한다.
- LSUN Churches에서 최신 기준인 1.12의 Density 점수를 달성한다.
- FFHQ에서 최신 기준인 1.20의 Density 점수를 달성한다.
- LSUN Bedroom에서 최신 기준인 0.83의 Coverage 점수를 달성한다.
- LSUN Churches에서 최신 기준인 0.73의 Coverage 점수를 달성한다.
- FFHQ에서 최신 기준인 0.80의 Coverage 점수를 달성한다.
- LSUN Bedroom에서 FID 점수 3.64를 기록하여 대부분의 기준 모델을 능가하며, StyleGAN2를 제외한 모든 기준 모델을 초월한다.
- LSUN Churches에서 FID 점수 4.07을 기록하여 대부분의 기준 모델을 능가하며, StyleGAN2를 제외한 모든 기준 모델을 초월한다.
- FFHQ에서 FID 점수 6.11을 기록하여 대부분의 기준 모델을 능가하며, StyleGAN2를 제외한 모든 기준 모델을 초월한다.
- 맥락 윈도우 집계와 병렬 토큰 예측 덕분에 원래 훈련 세트 해상도를 초월하는 고해상도 이미지를 생성한다.
- 자기적 VQ-VAE 모델 대비 계산 비용과 훈련 데이터 요구량을 감소시키며, 빠른 추론과 국소적 이미지 편집을 가능하게 한다.
- GAN 기반 모델과 달리 각 이미지의 likelihood 추정치를 제공함으로써 평가 향상과 조건부 생성 가능성 향상에 중요한 이점을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.