Skip to main content
QUICK REVIEW

[论文解读] Generating Images with Sparse Representations

Charlie Nash, Jacob Menick|arXiv (Cornell University)|Mar 5, 2021
Generative Adversarial Networks and Image Synthesis参考文献 37被引用 9
一句话总结

该论文提出 DCTransformer,一种基于 Transformer 的自回归模型,通过建模量化 DCT 系数的稀疏表示来生成高分辨率图像。通过将图像视为非零 DCT 通道、空间位置和系数值的三元组序列,该模型在 ImageNet 及其他数据集上实现了具有竞争力的样本质量和多样性,同时通过极少的架构修改即可实现高效的超分辨率和彩色化。

ABSTRACT

The high dimensionality of images presents architecture and sampling-efficiency challenges for likelihood-based generative models. Previous approaches such as VQ-VAE use deep autoencoders to obtain compact representations, which are more practical as inputs for likelihood-based models. We present an alternative approach, inspired by common image compression methods like JPEG, and convert images to quantized discrete cosine transform (DCT) blocks, which are represented sparsely as a sequence of DCT channel, spatial location, and DCT coefficient triples. We propose a Transformer-based autoregressive architecture, which is trained to sequentially predict the conditional distribution of the next element in such sequences, and which scales effectively to high resolution images. On a range of image datasets, we demonstrate that our approach can generate high quality, diverse images, with sample metric scores competitive with state of the art methods. We additionally show that simple modifications to our method yield effective image colorization and super-resolution models.

研究动机与目标

  • 解决基于像素的自回归生成模型在图像生成中面临的高维性和计算成本过高的问题。
  • 利用经典的图像压缩技术(如 DCT 量化)创建适合似然性生成建模的紧凑且稀疏的表示。
  • 开发一种可扩展的自回归 Transformer 架构,用于建模稀疏 DCT 序列,以实现高分辨率图像生成。
  • 证明稀疏 DCT 表示可在无需微调的情况下有效支持图像超分辨率和彩色化任务。
  • 在保持训练稳定性和完整数据分布覆盖的前提下,实现与最先进 GAN 模型相当的样本质量和多样性。

提出的方法

  • 使用 8×8 像素块和之字形排序将图像转换为量化 DCT 系数的 3D 张量。
  • 将非零 DCT 系数表示为稀疏三元组:(通道, 空间位置, 系数值),形成用于自回归建模的序列。
  • 训练基于 Transformer 的架构 DCTransformer,以基于先前元素预测序列中的下一个元素。
  • 采用分块训练机制,以高效处理长序列,无论图像大小如何,均保持恒定的内存和计算成本。
  • 生成过程采用自粗到精的排序方式,从低频分量开始,逐步生成高频细节。
  • 在下游任务中,通过修改输入序列结构对模型进行微调或条件控制——例如,将颜色通道置于末尾以实现彩色化。

实验结果

研究问题

  • RQ1稀疏 DCT 表示能否在高分辨率下实现高效且有效的自回归图像生成?
  • RQ2与基于像素或基于 VQ-VAE 的表示相比,通过量化 DCT 系数建模图像在样本质量和多样性方面表现如何?
  • RQ3是否可以仅通过极少的架构修改,将同一稀疏 DCT 基模型适配到超分辨率和彩色化任务?
  • RQ4与 GAN 相比,使用 DCT 等经典压缩技术是否能提升样本多样性和训练稳定性?
  • RQ5与标准自回归模型相比,稀疏表示在推理和内存成本方面能降低多少?

主要发现

  • 在 256×256 分辨率的 ImageNet 上,DCTransformer 的样本指标得分与最先进 GAN 模型相当,且样本多样性更优。
  • 在植物叶片数据集上,该模型在 2048×2048 分辨率下实现了高质量且多样的图像生成,这是首次使用神经网络在该分辨率下实现无条件生成。
  • 在图像上采样任务中,DCTransformer 生成的图像得分与原始验证集图像相当或更优,仅在精确度指标上略低。
  • 在图像彩色化任务中,模型的样本指标与真实数据非常接近,表明其与训练数据分布高度匹配。
  • 该模型通过使用相同架构和训练流程,实现了有效的零样本超分辨率,能够从低频 DCT 成分中生成高频细节。
  • 尽管需要大模型和大量计算资源,该方法仍实现了完整的数据分布覆盖,由于似然最大化目标,生成结果具有高度多样性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。