[论文解读] Simplified Stochastic Feedforward Neural Networks
本文提出Simplified-SFNN,一种新型的中间随机神经网络,通过利用预训练的确定性深度神经网络(DNNs),实现了大规模随机前馈神经网络(SFNNs)的高效训练。通过建立DNN → Simplified-SFNN → SFNN的层级结构,该方法将DNN参数迁移至Simplified-SFNN,同时保持性能并支持有效微调,在28层WRN模型下于CIFAR-100和SVHN数据集上取得了最先进结果。
It has been believed that stochastic feedforward neural networks (SFNNs) have several advantages beyond deterministic deep neural networks (DNNs): they have more expressive power allowing multi-modal mappings and regularize better due to their stochastic nature. However, training large-scale SFNN is notoriously harder. In this paper, we aim at developing efficient training methods for SFNN, in particular using known architectures and pre-trained parameters of DNN. To this end, we propose a new intermediate stochastic model, called Simplified-SFNN, which can be built upon any baseline DNNand approximates certain SFNN by simplifying its upper latent units above stochastic ones. The main novelty of our approach is in establishing the connection between three models, i.e., DNN->Simplified-SFNN->SFNN, which naturally leads to an efficient training procedure of the stochastic models utilizing pre-trained parameters of DNN. Using several popular DNNs, we show how they can be effectively transferred to the corresponding stochastic models for both multi-modal and classification tasks on MNIST, TFD, CASIA, CIFAR-10, CIFAR-100 and SVHN datasets. In particular, we train a stochastic model of 28 layers and 36 million parameters, where training such a large-scale stochastic network is significantly challenging without using Simplified-SFNN
研究动机与目标
- 为解决大规模随机前馈神经网络(SFNNs)训练中的挑战,此类网络因难以进行推理且缺乏直接反向传播支持而长期难以训练。
- 开发一种实用且高效的SFNN训练流程,利用现有DNN架构与训练技术,而非从零开始训练。
- 建立DNN、Simplified-SFNN与SFNN之间的理论与实证联系,实现参数迁移与性能保持。
- 通过在多个基准上的系统性实验,证明SFNN相比DNN具有更好的正则化效果,尤其在深层网络中表现更优。
提出的方法
- 提出Simplified-SFNN作为DNN与SFNN之间的中间模型,仅在高层引入随机单元,从而简化随机结构。
- 建立从DNN到Simplified-SFNN的严格参数转换,保持网络输入输出映射不变。
- 采用两种非线性激活函数,近似完整SFNN的行为,同时通过标准反向传播保持可训练性。
- 采用两阶段训练策略:先预训练DNN,再使用转换后的DNN参数对相应Simplified-SFNN进行微调。
- 在Simplified-SFNN的微调过程中应用已知的DNN技术(如Dropout和批量归一化),以增强泛化能力。
- 在训练期间使用M=5次采样的蒙特卡洛近似评估测试误差,确保性能估计的稳定性。
实验结果
研究问题
- RQ1预训练的DNN参数能否被有效迁移至随机模型,以提升训练效率与性能?
- RQ2Simplified-SFNN是否为训练原本难以直接训练的大规模SFNN提供了一条可行且高效的路径?
- RQ3Simplified-SFNN的随机特性是否能带来优于其DNN对应模型的泛化能力,尤其在深层架构中?
- RQ4所提出方法能否在CIFAR-10、CIFAR-100和SVHN等标准基准上实现最先进性能?
主要发现
- Simplified-SFNN在所有分类任务中均持续优于其对应的DNN基线,表现出更好的正则化效果,WRN-28模型在CIFAR-100上实现0.58%的误差降低。
- 通过Simplified-SFNN微调的WRN-28模型在CIFAR-100上测试误差为19.72%,优于原始DNN的0.58%。
- 在WRN架构中增加更多随机层(最多两层)可进一步降低误差率,表明随机深度与性能增益之间存在正相关关系。
- 所提方法使训练一个28层、含3600万参数的随机网络成为可能,若无Simplified-SFNN中间步骤,该任务极具挑战性。
- 该模型在中文字符生成任务中生成了多模态输出,展现出超越确定性DNN的表达能力,而这是通过简单参数迁移训练的SFNN所不具备的。
- 微调后的Simplified-SFNN在SVHN上实现3.06%的错误率,相比基线WRN模型,单层随机结构下提升0.19%,双层随机结构下同样提升0.19%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。