[论文解读] Joint Training Deep Boltzmann Machines for Classification
本文提出针对深度玻尔兹曼机(DBMs)的多预测(MP)训练方法,实现端到端训练,无需贪婪预训练。该方法采用一种新颖的变分近似和多推理技巧,仅使用单一统一模型即达到最先进的分类准确率(0.91% 测试误差),优于以往需额外使用多层感知机(MLP)进行微调的方法。
We introduce a new method for training deep Boltzmann machines jointly. Prior methods of training DBMs require an initial learning pass that trains the model greedily, one layer at a time, or do not perform well on classification tasks. In our approach, we train all layers of the DBM simultaneously, using a novel training procedure called multi-prediction training. The resulting model can either be interpreted as a single generative model trained to maximize a variational approximation to the generalized pseudolikelihood, or as a family of recurrent networks that share parameters and may be approximately averaged together using a novel technique we call the multi-inference trick. We show that our approach performs competitively for classification and outperforms previous methods in terms of accuracy of approximate inference and classification with missing inputs.
研究动机与目标
- 解决以往 DBM 训练方法依赖贪婪逐层预训练,随后再通过独立 MLP 进行微调的局限性。
- 开发一种统一的训练流程,将所有 DBM 组件(包括类别标签)在单一阶段内联合优化。
- 使 DBM 不仅在标准分类任务中表现良好,也能在缺失输入和一般概率查询等挑战性场景中表现优异。
- 证明单一、通过生成方式训练的 DBM 可达到或超越需任务特定架构扩展的模型性能。
提出的方法
- 提出多预测(MP)训练,一种新颖的训练方法,通过最大化对广义伪似然的变分近似,实现对所有 DBM 层的联合训练。
- 将 DBM 建模为具有共享参数的循环网络族,利用多推理技巧实现近似平均化,提升推理稳定性。
- 使用块 Gibbs 采样与固定点更新的均场推理,高效估计梯度,利用层间条件独立性。
- 应用 Rao-Blackwell 化与专为均场组件设计的负采样阶段,降低 PCD 学习过程中梯度估计的方差。
- 通过单一目标函数在单阶段内训练完整 DBM,消除对贪婪预训练或独立微调网络的需求。
- 利用多推理技巧整合多条推理路径,提升近似推理的鲁棒性与准确性,尤其在输入缺失情况下表现更优。
实验结果
研究问题
- RQ1能否在不进行贪婪预训练的前提下,对所有 DBM 层进行联合训练,同时保持强分类性能?
- RQ2与标准 DBM 训练(有无中心化)相比,多预测训练是否能实现更好的近似推理与分类准确率?
- RQ3单一、通过生成方式训练的 DBM 是否能像需任务特定微调的模型一样,有效处理缺失输入与一般性查询?
- RQ4在测试误差与超参数设置鲁棒性方面,MP-DBM 与最先进方法(Salakhutdinov & Hinton, 2009)相比表现如何?
- RQ5多推理技巧在概率 DBM 推理中,对推理质量与泛化能力的提升程度如何?
主要发现
- MP-DBM 在 MNIST 数据集上实现 0.91% 的测试误差,通过单阶段联合训练所有层,优于此前最先进方法(0.95%)——后者需额外使用 MLP 进行微调。
- 与基于中心化的训练方法相比,MP 训练对超参数选择的敏感度显著降低,在广泛的学习率与动量调度范围内均保持稳定性能。
- 在输入缺失的情况下进行分类时,MP-DBM 在大多数输入损坏程度下均优于标准 DBM 与基于中心化的 DBM。
- 在涉及多个缺失变量的一般概率查询中,MP-DBM 表现优于标准 DBM 与中心化 DBM,尤其在较大查询集合中优势更明显。
- 采用两倍隐藏单元数并结合多推理技巧的最佳 MP-DBM 实现 0.91% 测试误差,性能达到或超越使用独立 MLP 头的模型。
- 该方法使单一统一模型既能作为强大的生成模型,又能作为高精度分类器,无需引入任务特定的架构扩展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。