[论文解读] Learning Feature Hierarchies with Centered Deep Boltzmann Machines
本文提出中心化深度玻尔兹曼机(C-DBM),一种通过使用中心化状态重参数化能量函数的改进训练算法,以提升优化稳定性。通过引入偏移参数对Sigmoid输出进行中心化,该方法实现了更优的海森矩阵条件,从而实现深层网络的端到端联合训练,无需贪心预训练,最终在MNIST数据上实现更快收敛、更优的生成建模效果以及更丰富的层次化特征表示。
Deep Boltzmann machines are in principle powerful models for extracting the hierarchical structure of data. Unfortunately, attempts to train layers jointly (without greedy layer-wise pretraining) have been largely unsuccessful. We propose a modification of the learning algorithm that initially recenters the output of the activation functions to zero. This modification leads to a better conditioned Hessian and thus makes learning easier. We test the algorithm on real data and demonstrate that our suggestion, the centered deep Boltzmann machine, learns a hierarchy of increasingly abstract representations and a better generative model of data.
研究动机与目标
- 解决深度玻尔兹曼机中联合训练的不稳定性与收敛性差的问题。
- 通过中心化Sigmoid激活函数的输出,改善优化过程中的海森矩阵条件。
- 在无需贪心逐层预训练的情况下,实现深层生成模型中层次化表征的有效学习。
- 评估中心化是否能带来更优的判别性特征以及在真实数据上的生成建模能力提升。
- 研究参数中心化对深度玻尔兹曼机中表征质量与训练动态的影响。
提出的方法
- 使用中心化状态 ξ = x − β 重参数化能量函数,其中 β 为每个单元的偏移参数。
- 通过中心化状态重写模型对数似然梯度,以改善海森矩阵条件。
- 将初始偏移 β = sigm(b₀) 设定为强制Sigmoid输出初始中心化。
- 在重参数化下保持吉布斯分布不变,确保模型等价性。
- 通过在梯度计算中使用中心化状态,修改权重与偏置更新方式,实现中心化DBM。
- 采用线性反投影方法可视化DBM第一层与第二层所学习的滤波器。
实验结果
研究问题
- RQ1在深度玻尔兹曼机中对Sigmoid输出进行中心化,是否能带来更优的海森矩阵条件与更优的优化稳定性?
- RQ2中心化DBM是否能在无需贪心逐层预训练的情况下成功学习层次化表征?
- RQ3中心化对DBM第一层与第二层所学习滤波器的多样性与质量有何影响?
- RQ4中心化在多大程度上提升了顶层表征的判别能力?
- RQ5中心化如何影响生成样本的生成质量与类别平衡性?
主要发现
- 与非中心化版本相比,中心化DBM实现了更快且更稳定的训练,训练发散现象显著减少。
- 中心化带来了更优的海森矩阵条件,从而改善了优化过程的收敛行为。
- 在100个周期后,中心化DBM的顶层表征形成清晰、与标签相关的聚类,表明实现了有效的特征学习。
- 非中心化DBM倾向于将顶层表征压缩至低维流形,导致有用判别性特征的丢失。
- 中心化DBM的第二层滤波器表现出显著更高的多样性,表明其具备更强的特征抽象能力。
- 中心化DBM生成的样本更具平衡性与真实性,避免了非中心化模型中常见的类别不平衡问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。