Skip to main content
QUICK REVIEW

[论文解读] Degrees of Freedom in Deep Neural Networks

Tianxiang Gao, Vladimir Jojic|arXiv (Cornell University)|Mar 30, 2016
Machine Learning and Algorithms参考文献 16被引用 5
一句话总结

本文提出了一种高效的蒙特卡洛方法,用于估计深度S型神经网络中的自由度(DoF),表明由于隐式正则化,DoF显著低于参数数量——尤其是在更深的网络中。该方法提出了一种新的模型选择准则DoFAIC,其计算成本远低于交叉验证,但性能表现相当。

ABSTRACT

In this paper, we explore degrees of freedom in deep sigmoidal neural networks. We show that the degrees of freedom in these models is related to the expected optimism, which is the expected difference between test error and training error. We provide an efficient Monte-Carlo method to estimate the degrees of freedom for multi-class classification methods. We show degrees of freedom are lower than the parameter count in a simple XOR network. We extend these results to neural nets trained on synthetic and real data, and investigate impact of network's architecture and different regularization choices. The degrees of freedom in deep networks are dramatically smaller than the number of parameters, in some real datasets several orders of magnitude. Further, we observe that for fixed number of parameters, deeper networks have less degrees of freedom exhibiting a regularization-by-depth.

研究动机与目标

  • 开发一种高效的方法,用于估计深度神经网络在分类任务中的自由度。
  • 研究网络架构和正则化技术如何影响以自由度衡量的模型复杂度。
  • 评估自由度是否可作为交叉验证的可靠、计算高效的替代方案用于模型选择。
  • 证明深度网络中的自由度显著低于总参数数量,尤其在更深的架构中。
  • 验证所提出的DoFAIC准则作为k折交叉验证在模型选择中的可行、低成本替代方案。

提出的方法

  • 将Efron的自由度估计框架扩展至多项式逻辑回归,适用于深度网络中的多分类任务。
  • 提出一种蒙特卡洛算法,通过测量输出对训练数据扰动的敏感性来估计DoF,最多仅需一次额外前向传播。
  • 使用期望乐观度(测试误差与训练误差之差)作为自由度的代理变量,将其与模型复杂度关联。
  • 在合成数据集和真实数据集(MNIST、CIFAR-10)上对前馈S型网络应用该方法,调整深度、宽度和正则化策略。
  • 通过用估计的自由度替代AIC中的参数数量,推导出DoFAIC,实现高效模型选择。
  • 对每个模型仅使用一个蒙特卡洛样本估计DoF,以在准确性和计算成本之间取得平衡。

实验结果

研究问题

  • RQ1深度神经网络中的自由度如何随网络深度和宽度变化?
  • RQ2如dropout、权重衰减和输入噪声等正则化技术如何影响有效自由度?
  • RQ3是否可基于自由度构建一种模型选择准则,其性能接近交叉验证,但计算成本更低?
  • RQ4深度网络中的自由度是否显著低于总参数数量?若是,低多少?
  • RQ5DoFAIC准则与标准AIC和交叉验证在选择最优网络架构方面相比如何?

主要发现

  • 深度S型网络中的自由度远低于总参数数量,部分真实数据集显示参数数量比DoF高出几个数量级。
  • 与参数数量相同的浅层网络相比,更深的网络表现出更少的自由度,体现了‘深度正则化’效应。
  • 权重衰减对自由度的影响具有高度非线性和强效性,尤其在深层网络中,与岭回归中的线性缩放形成鲜明对比。
  • 在所有测试数据集中,DoFAIC与5折交叉验证误差的Spearman等级相关系数接近完美(ρ > 0.98),而朴素AIC因高估模型复杂度导致负相关。
  • DoFAIC准则在所有数据集中均选择了与交叉验证相同的最优模型,证实其可靠性和高效性。
  • 该方法每模型最多仅需两次训练(一次原始数据,一次扰动数据),显著优于k折交叉验证所需的最多k次训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。