[论文解读] Learning Discrete Distributions by Dequantization
本文提出了一种用于深度密度模型中去量化的一般化潜在变量框架,引入了重要性加权和Rényi去量化目标,以及用于提升灵活性的自回归去量化(ARD)。ARD在CIFAR10上实现了3.06比特/维度的最先进负对数似然,且无需在采样时使用自回归逆运算,显著优于非自回归模型的先前方法。
Media is generally stored digitally and is therefore discrete. Many successful deep distribution models in deep learning learn a density, i.e., the distribution of a continuous random variable. Naïve optimization on discrete data leads to arbitrarily high likelihoods, and instead, it has become standard practice to add noise to datapoints. In this paper, we present a general framework for dequantization that captures existing methods as a special case. We derive two new dequantization objectives: importance-weighted (iw) dequantization and Rényi dequantization. In addition, we introduce autoregressive dequantization (ARD) for more flexible dequantization distributions. Empirically we find that iw and Rényi dequantization considerably improve performance for uniform dequantization distributions. ARD achieves a negative log-likelihood of 3.06 bits per dimension on CIFAR10, which to the best of our knowledge is state-of-the-art among distribution models that do not require autoregressive inverses for sampling.
研究动机与目标
- 解决在离散数据上对连续密度模型进行最大似然训练时,由于离散空间与连续空间之间的拓扑差异,导致似然值可无限增大的根本问题。
- 开发一个统一的去量化框架,推广现有方法,并实现对离散数据更灵活、更有效的建模。
- 通过引入新型去量化目标——重要性加权和Rényi去量化——超越标准变分推断,改进离散分布的似然估计。
- 利用自回归流(ARD)提升去量化灵活性,实现更紧致的变分下界和更优的密度建模,且在采样时无需进行逆运算。
- 通过实证评估去量化灵活性与目标选择对二值MNIST和CIFAR10上对数似然性能的影响。
提出的方法
- 本文将去量化建模为潜在变量模型,其中离散数据x通过学习的条件分布q(v|x)进行去量化,v表示连续潜在变量。
- 提出两种新型去量化目标:使用多组样本以收紧变分下界的加权重要性(iw)去量化,以及基于变分Rényi散度的Rényi去量化。
- 提出自回归去量化(ARD)作为灵活的去量化分布,利用自回归流建模q(v|x),且在采样时无需进行逆运算。
- 该方法利用现有的归一化流架构(如Glow、RealNVP),通过增加1×1卷积和缩放变换构建密度模型,而ARD组件仅用于去量化。
- 该框架支持使用不同目标(vi、iw、Rényi)和去量化分布(均匀、高斯、ARD)进行训练,通过ELBO和重要性加权对数似然估计进行评估。
- 模型通过梯度下降端到端训练,最终模型采样时无需反转自回归组件,因为去量化噪声不会被反转。
实验结果
研究问题
- RQ1在离散数据上,不同去量化目标(变分推断、重要性加权、Rényi)在对数似然性能上的表现如何比较?
- RQ2提升去量化分布的灵活性在多大程度上能改善变分下界的紧致性和似然估计?
- RQ3自回归去量化(ARD)是否能在不依赖自回归逆运算进行采样的前提下,实现最先进对数似然性能?
- RQ4使用更复杂的去量化目标和分布时,计算成本与性能之间的权衡如何?
- RQ5在不同数据位深下,去量化方法表现如何,特别是在二值MNIST等低比特数据集上?
主要发现
- 自回归去量化(ARD)在CIFAR10上实现了3.06比特/维度的负对数似然,据作者所知,这是不需在采样时使用自回归逆运算的模型中的最先进结果。
- 在使用简单去量化分布(如均匀或高斯)时,重要性加权和Rényi去量化目标相比标准变分推断显著提升了对数似然性能。
- 在二值MNIST上,使用iw或Rényi去量化相比vi的改进为0.20比特/维度(约12%的相对提升),表明其在低比特深度数据上具有显著优势。
- ARD在ELBO和负对数似然方面均持续优于其他去量化方法,证明了灵活去量化分布的价值。
- 作者观察到,先使用vi训练早期周期,再用iw或Rényi去量化进行微调,可在降低计算成本的同时获得强大性能。
- 该框架实现了高质量的密度建模,且在采样时无需反转自回归组件,使ARD在实际应用中既强大又高效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。