Skip to main content
QUICK REVIEW

[论文解读] Locally Masked Convolution for Autoregressive Models

Ajay N. Jain, Pieter Abbeel|ArXiv.org|Jun 22, 2020
Generative Adversarial Networks and Image Synthesis参考文献 45被引用 7
一句话总结

本文提出局部掩码卷积(LMConv),这是一种对2D卷积的简单而有效的改进,通过在特征图上应用位置特定的掩码,使单个深度神经网络能够支持任意自回归生成顺序。通过在多种顺序间共享权重,LMConv在无条件图像生成(CIFAR-10上为2.89比特/维度)和全局一致的图像补全任务中均实现了最先进性能,且无需针对特定任务进行微调。

ABSTRACT

High-dimensional generative models have many applications including image compression, multimedia generation, anomaly detection and data completion. State-of-the-art estimators for natural images are autoregressive, decomposing the joint distribution over pixels into a product of conditionals parameterized by a deep neural network, e.g. a convolutional neural network such as the PixelCNN. However, PixelCNNs only model a single decomposition of the joint, and only a single generation order is efficient. For tasks such as image completion, these models are unable to use much of the observed context. To generate data in arbitrary orders, we introduce LMConv: a simple modification to the standard 2D convolution that allows arbitrary masks to be applied to the weights at each location in the image. Using LMConv, we learn an ensemble of distribution estimators that share parameters but differ in generation order, achieving improved performance on whole-image density estimation (2.89 bpd on unconditional CIFAR10), as well as globally coherent image completions. Our code is available at https://ajayjain.github.io/lmconv.

研究动机与目标

  • 解决自回归模型受限于单一固定生成顺序(如光栅扫描)的局限性,这种限制会妨碍在图像补全等任务中有效利用上下文信息。
  • 使单个卷积神经网络能够在不引入独立参数化或计算开销的前提下,支持多种自回归生成顺序。
  • 通过使用共享权重在多个顺序间进行贝叶斯模型平均,提升似然估计与生成质量。
  • 通过在推理时基于观测上下文动态选择最优生成顺序,实现全局一致的图像补全。
  • 为现有卷积架构提供一种高效、可扩展且模块化的扩展方法,在保留归纳偏置的同时实现灵活的顺序控制。

提出的方法

  • 提出局部掩码卷积(LMConv),一种在每个空间位置对特征图应用可学习、空间可变掩码的层,从而支持任意自回归顺序。
  • 在特征层面而非输入或权重上应用掩码,使同一组网络参数可被用于不同生成顺序。
  • 通过将掩码集成到标准卷积操作的im2col与col2im变换中,以矩阵乘法高效实现LMConv。
  • 通过单次前向传播端到端训练,同时并行计算多个顺序下的条件概率,利用掩码特征图强制实现因果性。
  • 使用同一组网络权重估计对应于联合分布不同自回归分解的多个图模型。
  • 在推理时支持基于观测上下文的顺序选择,例如在图像补全任务中选择能最大化可见上下文的顺序。

实验结果

研究问题

  • RQ1单个卷积神经网络是否能在不引入独立参数化的情况下支持多种自回归生成顺序?
  • RQ2如何在保持计算效率的前提下,高效地在卷积架构中实现任意生成顺序?
  • RQ3通过共享权重支持多种顺序是否能提升图像建模中的似然估计与生成质量?
  • RQ4局部掩码卷积是否能在不显式针对修补任务进行训练的情况下,实现全局一致的图像补全?
  • RQ5通过LMConv实现的顺序无关训练在CIFAR-10等标准基准上的性能提升程度如何?

主要发现

  • 所提出的局部掩码卷积(LMConv)通过在特征图上应用位置特定的掩码,使单个网络能够支持任意自回归生成顺序。
  • LMConv在无条件CIFAR-10数据集上实现了2.89比特/维度的最先进测试集似然,优于PixelCNN++。
  • 通过在推理时基于观测上下文动态选择最优生成顺序,该模型能够实现全局一致的图像补全。
  • 该方法通过单次前向传播实现多个顺序的并行密度估计,同时通过基于矩阵乘法的实现方式保持计算效率。
  • 图像补全结果表明,该模型无需针对修补掩码进行特定训练,即可通过上下文感知的顺序选择生成一致的输出。
  • 该方法将MADE推广至卷积架构,同时保留了局部感受野的归纳偏置,从而实现对长距离依赖关系的更好建模。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。