Skip to main content
QUICK REVIEW

[论文解读] A Probabilistic Framework for Deep Learning

Ankit Patel, Tan M. Nguyen|arXiv (Cornell University)|Dec 6, 2016
Generative Adversarial Networks and Image Synthesis参考文献 31被引用 15
一句话总结

本文提出了深度生成混合模型(DRMM),这是一种生成式概率框架,通过分层仿射变换对数据中的干扰变量进行建模。研究表明,DRMM中的最大-求和推理可精确重现深度卷积神经网络(DCN)的操作,为DCN提供了基于第一性原理的推导,并支持通过EM算法进行训练,该方法在MNIST和CIFAR10基准上实现了更快的收敛速度和具有竞争力的准确率。

ABSTRACT

We develop a probabilistic framework for deep learning based on the Deep Rendering Mixture Model (DRMM), a new generative probabilistic model that explicitly capture variations in data due to latent task nuisance variables. We demonstrate that max-sum inference in the DRMM yields an algorithm that exactly reproduces the operations in deep convolutional neural networks (DCNs), providing a first principles derivation. Our framework provides new insights into the successes and shortcomings of DCNs as well as a principled route to their improvement. DRMM training via the Expectation-Maximization (EM) algorithm is a powerful alternative to DCN back-propagation, and initial training results are promising. Classification based on the DRMM and other variants outperforms DCNs in supervised digit classification, training 2-3x faster while achieving similar accuracy. Moreover, the DRMM is applicable to semi-supervised and unsupervised learning tasks, achieving results that are state-of-the-art in several categories on the MNIST benchmark and comparable to state of the art on the CIFAR10 benchmark.

研究动机与目标

  • 开发一种基于第一性原理的生成式概率框架,通过建模潜在干扰变量来解释深度卷积神经网络(DCN)的成功。
  • 通过生成建模为DCN操作(如卷积、ReLU和最大池化)提供理论基础。
  • 提出一种替代反向传播训练的方法,即通过EM算法实现,以提升训练效率和泛化能力。
  • 将该框架扩展至半监督和无监督学习,展示其在基准数据集上的优异性能。

提出的方法

  • 提出深度生成混合模型(DRMM),一种分层生成模型,通过在多层之间使用仿射变换的乘积显式建模干扰变化。
  • 推导出DRMM中最大-求和推理与DCN前向传播之间的等价性,为卷积、ReLU和池化层提供概率解释。
  • 将生成式DRMM松弛为判别式模型,以优化偏差-方差权衡,从而实现有效的分类。
  • 使用期望最大化(EM)算法训练DRMM,提供一种替代反向传播的方法,具有更快的收敛速度。
  • 在标准基准(如MNIST和CIFAR10)上,将该框架应用于监督、半监督和无监督学习任务。
  • 通过最大-求和/乘积算法进行消息传递,实现高效推理,并通过参数共享减少过拟合。

实验结果

研究问题

  • RQ1如何从一个基于第一性原理的概率生成模型中推导出深度卷积神经网络?
  • RQ2干扰变量在深度学习中起什么作用?如何显式建模它们以提升泛化能力?
  • RQ3EM算法能否作为训练深层网络的可行替代方案,实现与反向传播相当或更优的性能?
  • RQ4与最先进方法相比,DRMM框架在半监督和无监督学习设置下的表现如何?
  • RQ5卷积、ReLU和最大池化等DCN关键组件可以赋予何种概率解释?

主要发现

  • DRMM中的最大-求和推理可精确重现深度卷积神经网络的前向传播过程,为DCN操作提供了基于第一性原理的推导。
  • 通过EM算法训练DRMM,其训练速度比反向传播快2–3倍,同时在MNIST数字分类任务上达到相似的准确率。
  • 在MNIST基准上,5层DRMM在监督学习中达到0.89%的测试误差,在使用6万张无标签图像进行无监督预训练时,测试误差降至0.58%。
  • 在仅使用100张标签图像的半监督学习中,DRMM达到3.50%的测试误差,优于其他方法(包括卷积网络和Ladder网络)。
  • 在CIFAR10上,9层DRMM在使用5万张标签图像时达到11.37%的测试误差,与LadderNet和ImprovedGAN等最先进模型性能相当。
  • DRMM学习到的滤波器和重建图像反映了有意义的特征层次结构,展示了无需监督即可实现有效的表征学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。