Skip to main content
QUICK REVIEW

[论文解读] Auto-encoders: reconstruction versus compression

Yann Ollivier|arXiv (Cornell University)|Mar 30, 2014
Generative Adversarial Networks and Image Synthesis参考文献 17被引用 17
一句话总结

本文建立了自编码器重构误差训练与通过最小描述长度(MDL)实现数据压缩之间的理论联系。结果表明,最小化码长——等价于最优压缩——需要在重构误差中加入信息论正则化项,这些项对应于从特征到输出的去噪准则,并确定了去噪自编码器的最优、与数据相关的噪声水平。

ABSTRACT

We discuss the similarities and differences between training an auto-encoder to minimize the reconstruction error, and training the same auto-encoder to compress the data via a generative model. Minimizing a codelength for the data using an auto-encoder is equivalent to minimizing the reconstruction error plus some correcting terms which have an interpretation as either a denoising or contractive property of the decoding function. These terms are related but not identical to those used in denoising or contractive auto-encoders [Vincent et al. 2010, Rifai et al. 2011]. In particular, the codelength viewpoint fully determines an optimal noise level for the denoising criterion.

研究动机与目标

  • 研究自编码器中最小化重构误差与通过MDL最小化数据码长以实现最优压缩之间的关系。
  • 确定标准自编码器训练是否隐式最小化码长,若否,则需进行何种修改。
  • 推导一个包含重构误差和信息论正则化项的码长的变分上界。
  • 将码长框架与去噪及收缩自编码器联系起来,展示MDL如何确定最优超参数(如噪声水平)。
  • 探讨将输出方差作为可学习参数的影响,以改善压缩界并符合相对误差最小化。

提出的方法

  • 使用最小描述长度(MDL)原则,将自编码视为数据压缩问题,目标是最小化数据的码长。
  • 应用变分界推导出依赖于重构误差和附加正则化项的码长上界。
  • 推导出适用于连续特征空间的紧码长界(命题2),当编码器与解码器为概率互逆时,该界趋近于真实码长。
  • 从特征到输出引入去噪准则,其最优噪声水平由重构函数的逆Hessian矩阵决定。
  • 通过MDL视角重新解释收缩自编码器,表明码长最小化会惩罚从特征到输出的较大导数,惩罚项基于雅可比矩阵的行范数。
  • 提出将输出方差作为参数以改善压缩界,从而导出包含平方误差对数和量化噪声的重构目标。

实验结果

研究问题

  • RQ1在自编码器中最小化重构误差是否对应于MDL原则下数据码长的最小化?
  • RQ2为使重构误差训练等价于码长最小化,还需添加哪些额外的正则化项?
  • RQ3MDL框架能否确定去噪自编码器的最优、与数据相关的噪声水平?其与固定噪声水平有何不同?
  • RQ4码长最小化准则与收缩自编码器有何关联?其在雅可比矩阵上的惩罚结构如何?
  • RQ5将输出方差建模为可学习参数,对码长界和重构误差有何影响?

主要发现

  • 仅最小化重构误差无法实现码长最小化;必须加入额外的信息论正则化项才能实现最优压缩。
  • 码长界包含一个从特征到输出的去噪惩罚项,该惩罚项与以往工作中的输入到特征的去噪不同。
  • 去噪的最优噪声水平由重构函数的逆Hessian矩阵决定,且应对每个数据样本分别设置。
  • 码长框架导致对从特征到输出的大导数施加惩罚,这与标准收缩自编码器中使用的Frobenius范数不同。
  • 将输出方差作为参数引入后,重构目标变为最小化平方误差的对数,与相对误差最小化一致,并改善了压缩界。
  • 当编码器与解码器为概率互逆时,变分码长界是紧的,且为自编码器的压缩训练提供了合理依据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。