Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Images with Sparse Representations

Charlie Nash, Jacob Menick|arXiv (Cornell University)|2021. 03. 05.
Generative Adversarial Networks and Image Synthesis참고 문헌 37인용 수 9
한 줄 요약

이 논문은 양자화된 DCT 계수의 희박한 표현을 모델링하여 고해상도 이미지를 생성하는 Transformer 기반의 자동회귀 모델인 DCTransformer을 제안한다. 이미지를 비제로 DCT 채널, 공간적 위치, 계수 값의 삼중조로 간주함으로써, ImageNet 및 기타 데이터셋에서 경쟁적인 샘플 품질과 다양성을 달성하면서도, 최소한의 아키텍처 수정으로 효율적인 초해상도 및 색상화를 가능하게 한다.

ABSTRACT

The high dimensionality of images presents architecture and sampling-efficiency challenges for likelihood-based generative models. Previous approaches such as VQ-VAE use deep autoencoders to obtain compact representations, which are more practical as inputs for likelihood-based models. We present an alternative approach, inspired by common image compression methods like JPEG, and convert images to quantized discrete cosine transform (DCT) blocks, which are represented sparsely as a sequence of DCT channel, spatial location, and DCT coefficient triples. We propose a Transformer-based autoregressive architecture, which is trained to sequentially predict the conditional distribution of the next element in such sequences, and which scales effectively to high resolution images. On a range of image datasets, we demonstrate that our approach can generate high quality, diverse images, with sample metric scores competitive with state of the art methods. We additionally show that simple modifications to our method yield effective image colorization and super-resolution models.

연구 동기 및 목표

  • 이미지에 대한 픽셀 기반 자동회귀 생성 모델의 높은 차원성과 계산 비용 문제를 해결하기 위해.
  • 기존의 이미지 압축 기법, 예를 들어 DCT 양자화를 활용하여 가능성 있는 가능성 기반 생성 모델에 적합한 압축되고 희박한 표현을 만들기 위해.
  • 고해상도 이미지 생성을 위한 희박한 DCT 시퀀스를 모델링할 수 있는 확장 가능한 자동회귀 Transformer 아키텍처를 개발하기 위해.
  • 희박한 DCT 표현이 재학습 없이도 효과적인 이미지 초해상도 및 색상화를 가능하게 하는지 보여주기 위해.
  • 최신 GAN과 비교해도 경쟁적인 샘플 품질과 다양성을 확보하면서도, 학습 안정성과 전체 데이터 분포 커버리지 유지하기 위해.

제안 방법

  • 이미지를 8×8 픽셀 블록과 지그재그 순서를 사용하여 양자화된 DCT 계수의 3차원 텐서로 변환한다.
  • 비제로 DCT 계수는 (채널, 공간적 위치, 계수 값)의 희박한 3중조로 표현되며, 자동회귀 모델링을 위한 시퀀스를 형성한다.
  • 이전 요소들을 조건으로 다음 요소를 예측하는 데 사용되는 Transformer 기반 아키텍처인 DCTransformer를 훈련한다.
  • 긴 시퀀스를 효율적으로 처리하기 위해 청크 기반 훈련 제도를 사용하며, 이미지 크기에 관계없이 일정한 메모리 및 계산 비용을 유지한다.
  • 생성 과정은 저주파 성분에서 시작하여 고주파 세부 정보로 향하는 거친 것에서부터 세밀한 순서를 따르며 진행된다.
  • 하류 작업을 위해 모델은 미세조정되거나 입력 시퀀스의 구조를 수정함으로써 조건화된다 — 예를 들어, 색상화 작업에서는 색상 채널을 시퀀스의 끝에 배치한다.

실험 결과

연구 질문

  • RQ1희박한 DCT 표현은 고해상도에서 효과적이고 효율적인 자동회귀 이미지 생성을 가능하게 할 수 있는가?
  • RQ2픽셀 기반 또는 VQ-VAE 기반 표현과 비교할 때, 양자화된 DCT 계수를 통한 이미지 모델링은 샘플 품질과 다양성 측면에서 어떻게 다른가?
  • RQ3동일한 희박한 DCT 기반 모델이 아키텍처 수정을 최소화하면서 초해상도 및 색상화 작업에 적응할 수 있는가?
  • RQ4DCT와 같은 전통적인 압축 기법의 사용은 GAN과 비교해 샘플 다양성과 학습 안정성 측면에서 향상되는가?
  • RQ5표준 자동회귀 모델과 비교해 희박한 표현이 추론 및 메모리 비용을 얼마나 줄이는가?

주요 결과

  • DCTransformer는 256×256 해상도에서 ImageNet에서 최신 GAN과 경쟁하는 샘플 지표 점수를 기록했으며, 샘플 다양성 측면에서 향상된 성능을 보였다.
  • 식물 잎 데이터셋에서 2048×2048 해상도에서 고해상도의 고품질이고 다양한 이미지를 생성했으며, 이는 신경망을 사용한 동일한 조건에서의 첫 번째 무조건적 생성 사례이다.
  • 이미지 업샘플링 작업에서는 DCTransformer로 업샘플링한 이미지가 정밀도 지표를 제외한 다른 지표에서 원본 검증 세트 이미지와 유사하거나 더 좋은 점수를 기록했다.
  • 이미지 색상화 작업에서는 모델의 샘플 지표가 진짜 데이터와 매우 유사하여 훈련 데이터와 강한 분포 일치를 보였다.
  • 동일한 아키텍처와 훈련 절차를 사용하여 저주파 DCT 성분에서 고주파 세부 정보를 생성함으로써, 제로샷 초해상도 생성을 효과적으로 수행했다.
  • 크고 복잡한 모델과 상당한 계산 자원이 요구됨에도 불구하고, 가능도 최대화 목표 덕분에 전체 데이터 분포 커버리지가 이루어져 매우 다양한 출력을 생성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.