[论文解读] Bayesian Learning of Neural Network Architectures
本文提出了一种贝叶斯神经网络框架,通过使用指数分布和变分推断,将层大小和网络深度作为可学习的随机变量,实现了计算开销极小的端到端可微架构搜索。该方法在小样本数据集上提升了泛化性能,并增强了对初始化的鲁棒性,在数据有限的CIFAR-10数据集上相比固定架构最高提升4%。
In this paper we propose a Bayesian method for estimating architectural parameters of neural networks, namely layer size and network depth. We do this by learning concrete distributions over these parameters. Our results show that regular networks with a learnt structure can generalise better on small datasets, while fully stochastic networks can be more robust to parameter initialisation. The proposed method relies on standard neural variational learning and, unlike randomised architecture search, does not require a retraining of the model, thus keeping the computational overhead at minimum.
研究动机与目标
- 为解决传统神经网络架构超参数搜索效率低下的问题,该方法避免了重复训练。
- 在贝叶斯框架内实现层大小和深度等架构超参数的端到端学习,将其作为随机变量处理。
- 通过避免每次架构变更后的重新训练,相比随机搜索或强化学习-based NAS,显著降低计算成本。
- 通过结构化的架构先验和后验推断,提升模型的泛化能力和鲁棒性。
- 通过层大小和深度的后验分布,提供架构决策的可解释性。
提出的方法
- 通过参数化的指数分布(Gumbel-Softmax)对层大小和网络深度建模为随机变量,以实现可微采样。
- 采用变分推断近似架构参数的后验分布,使用因子化变分后验以提高效率。
- 通过离散分类分布的连续松弛,利用反向传播优化架构参数,实现基于梯度的学习。
- 该框架与标准贝叶斯神经网络集成,通过高斯变分后验保持权重不确定性。
- 在架构参数上施加先验,以编码专家知识,例如偏好更少的滤波器数量或更深的网络。
- 该方法在训练和推理过程中可从架构连续体中采样,支持基于集成的正则化。
实验结果
研究问题
- RQ1能否在贝叶斯框架中,通过可微推断有效学习层大小和深度等架构超参数?
- RQ2与固定架构相比,架构参数的端到端学习在小样本数据集上的泛化性能如何?
- RQ3与标准神经网络相比,该方法在权重初始化上的鲁棒性提升程度如何?
- RQ4架构参数的后验分布能否揭示架构设定不当或最优配置?
- RQ5与随机搜索或强化学习-based NAS相比,该方法在效率和性能上表现如何?
主要发现
- 在仅使用1,000个训练样本的CIFAR-10数据集上,自适应架构方法将测试准确率从34.98%提升至38.95%,提高了3.97个百分点。
- 自适应大小网络在缩减版MNIST数据集上达到95.67%的准确率,优于刚性基线1.20个百分点。
- 自适应深度模型在数据缩减的Fashion-MNIST上将测试准确率从80.32%提升至80.83%,表明对初始化和数据稀缺具有鲁棒性。
- 层大小和深度的后验分布提供了对模型容量的可解释洞察,揭示了欠拟合或过拟合趋势。
- 该方法在无需重新训练的情况下实现了显著的性能提升,由于采用可微架构搜索,计算开销保持较低。
- 从采样架构中集成预测结果可作为有效的正则化手段,减少过拟合并提升泛化性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。