Skip to main content
QUICK REVIEW

[论文解读] Inconsistency, Instability, and Generalization Gap of Deep Neural Network Training

Rie Johnson, Tong Zhang|arXiv (Cornell University)|May 31, 2023
Neural Networks and Applications被引用 4
一句话总结

本文提出将模型输出的不一致性和不稳定性作为深度神经网络泛化差距的关键预测因子,通过理论分析与实验验证表明,不一致性——可在无标签数据上测量——在预测泛化性能方面优于损失景观的尖锐度。通过算法正则化减少不一致性可提升测试性能,为协同蒸馏和集成等方法提供了理论基础。

ABSTRACT

As deep neural networks are highly expressive, it is important to find solutions with small generalization gap (the difference between the performance on the training data and unseen data). Focusing on the stochastic nature of training, we first present a theoretical analysis in which the bound of generalization gap depends on what we call inconsistency and instability of model outputs, which can be estimated on unlabeled data. Our empirical study based on this analysis shows that instability and inconsistency are strongly predictive of generalization gap in various settings. In particular, our finding indicates that inconsistency is a more reliable indicator of generalization gap than the sharpness of the loss landscape. Furthermore, we show that algorithmic reduction of inconsistency leads to superior performance. The results also provide a theoretical basis for existing methods such as co-distillation and ensemble.

研究动机与目标

  • 识别深度神经网络中与泛化差距相关的基本属性,尤其关注随机训练动态的影响。
  • 构建一个理论框架,将泛化差距与模型输出的不一致性和不稳定性联系起来,且该框架可在无标签数据上估计。
  • 通过实证验证,不一致性是比损失景观尖锐度更强的泛化差距预测因子。
  • 证明通过算法手段降低不一致性可提升模型泛化能力与性能。
  • 为现有技术(如协同蒸馏和集成学习)提供理论基础。

提出的方法

  • 提出一个基于三个组成部分的泛化差距理论界:模型输出的不一致性、模型输出的不稳定性,以及模型参数分布的信息论不稳定性。
  • 将不一致性定义为同一训练数据上多次前向传播中模型输出的期望1-范数差异,通过多次前向传播进行估计。
  • 将不稳定性定义为由于不同训练数据样本导致的模型输出差异的期望,通过多个训练集进行估计。
  • 采用基于KL散度的不一致性正则化方法,实现平滑优化,并与标准交叉熵目标兼容。
  • 利用无标签数据估计不一致性和不稳定性,避免依赖标签或完整测试集访问。
  • 在训练过程中通过最小化同一输入两次前向传播预测结果之间的KL散度,实施一致性正则化。

实验结果

研究问题

  • RQ1深度神经网络中,模型输出的不一致性和不稳定性如何与泛化差距相关?
  • RQ2不一致性和不稳定性是否可在无标签数据上可靠估计?其对泛化性能的预测能力如何?
  • RQ3不一致性是否比损失景观尖锐度更可靠的泛化差距指标?
  • RQ4通过算法手段降低不一致性是否能带来更好的泛化能力与最先进性能?
  • RQ5不一致性与现有方法(如协同蒸馏和集成学习)之间存在怎样的理论与实证关联?

主要发现

  • 在多种深度学习设置下,模型输出的不一致性和不稳定性均与泛化差距强相关。
  • 不一致性是比损失景观尖锐度更可靠的泛化差距预测因子,尤其在尖锐度较高但泛化误差较低的情况下表现更优。
  • 当训练随机性较低时,仅不一致性即可提供与不一致性加不稳定性联合效应几乎相当的预测能力。
  • 通过算法手段降低不一致性可显著提升测试性能,证明其在模型训练中的实际应用价值。
  • 理论分析表明,泛化差距受不一致性、不稳定性以及参数分布不稳定性所限制,其中不一致性起核心作用。
  • 研究结果为协同蒸馏和集成方法提供了理论基础,这些方法通过模型平均隐式降低不一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。