[论文解读] Learning Representations by Maximizing Compression
本文提出了一种基于压缩的表示学习算法,通过可学习的自编码器式架构按顺序预测像素来建模图像数据。通过在序列排序下最大化像素预测的似然度,该方法在MNIST和USPS数据集上实现了最先进的压缩性能,学习到的滤波器可解释性高,与RBM和去噪自编码器所学特征相似,同时支持精确的似然度计算和通过算术编码实现的高效采样。
We give an algorithm that learns a representation of data through compression. The algorithm 1) predicts bits sequentially from those previously seen and 2) has a structure and a number of computations similar to an autoencoder. The likelihood under the model can be calculated exactly, and arithmetic coding can be used directly for compression. When training on digits the algorithm learns filters similar to those of restricted boltzman machines and denoising autoencoders. Independent samples can be drawn from the model by a single sweep through the pixels. The algorithm has a good compression performance when compared to other methods that work under random ordering of pixels.
研究动机与目标
- 开发一种基于数据压缩的表示学习算法,利用像素的序列预测来建模复杂且高维的数据分布。
- 实现模型下数据似然度的精确计算,从而支持直接使用算术编码进行压缩。
- 通过端到端训练学习有意义且解耦的表示,且在随机像素排序下具有泛化能力。
- 证明压缩性能与所学表示质量之间的相关性,以MNIST和USPS作为基准。
提出的方法
- 模型通过双路径架构按顺序从先前观察到的像素预测每个像素:一条直接路径(R)和一条通过隐藏层的非线性路径(UV),两者结合后经Sigmoid函数输出概率。
- 隐藏层状态通过仅使用当前像素值和学习权重的方式逐步更新,从而实现每像素O(nh nx + nx^2)操作的高效在线推理。
- 模型通过最大化观测像素值的对数似然进行训练,使用二元交叉熵损失:L = -Σ[xi log(yi) + (1-xi) log(1-yi)]。
- 该架构支持精确的似然度估计,并可通过单次像素遍历实现从模型中采样,利用预测概率随机生成新图像。
- 通过L2权重衰减和早停法进行正则化,以防止过拟合,尤其是在增加隐藏单元数量时。
- 通过将像素分布建模为简单的一维分布(如高斯分布)的混合,该框架可扩展至实值数据。
实验结果
研究问题
- RQ1通过按顺序预测像素来学习压缩数据的模型,能否学习到有意义且解耦的表示?
- RQ2与RBM和去噪自编码器等成熟生成模型相比,该基于压缩的学习方法在压缩性能和表示质量方面表现如何?
- RQ3该模型精确计算似然度的能力是否足以实现有效的压缩和采样,而无需依赖近似推理?
- RQ4该方法对随机像素排序的鲁棒性如何?在该条件下是否优于上下文感知系统(如DjVu)?
主要发现
- 使用200个隐藏单元时,该模型在USPS数据集上达到每图像84.5比特,在MNIST数据集上达到94.8比特,优于基线方法(包括RBM和聚类法)。
- 在使用1000个隐藏单元并加入正则化后,该模型在MNIST数据集上达到每图像81.0比特,表明在随机像素排序下仍具备强大的压缩性能。
- 所学滤波器类似于笔画和边缘检测器,展现出良好的可解释性,并与RBM和去噪自编码器所学特征相似。
- 该模型支持精确的似然度计算,并可直接使用算术编码进行压缩,编码比特流与模型的对数似然相等。
- 通过单次前向传播即可从模型中采样,利用基于先前生成值的像素随机预测生成合理的数字图像。
- 通过将像素分布建模为简单一维分布(如高斯分布)的混合,该方法可良好推广至实值数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。