Skip to main content
QUICK REVIEW

[论文解读] Channel-Wise Early Stopping without a Validation Set via NNK Polytope Interpolation

David Bonet, Antonio Ortega|arXiv (Cornell University)|Jul 27, 2021
Domain Adaptation and Few-Shot Learning参考文献 25被引用 4
一句话总结

本文提出通道加权深度NNK(CW-DeepNNK),一种用于卷积神经网络的新型早停准则,通过在单个网络通道上使用NNK图进行局部多面体插值,估计泛化性能。与标准方法不同,该方法无需验证集,可实现通道级的早停时间,并通过利用任务特定的性能度量和高效的LOO计算频率,实现更短的训练时间与最先进的测试准确率。

ABSTRACT

State-of-the-art neural network architectures continue to scale in size and deliver impressive generalization results, although this comes at the expense of limited interpretability. In particular, a key challenge is to determine when to stop training the model, as this has a significant impact on generalization. Convolutional neural networks (ConvNets) comprise high-dimensional feature spaces formed by the aggregation of multiple channels, where analyzing intermediate data representations and the model's evolution can be challenging owing to the curse of dimensionality. We present channel-wise DeepNNK (CW-DeepNNK), a novel channel-wise generalization estimate based on non-negative kernel regression (NNK) graphs with which we perform local polytope interpolation on low-dimensional channels. This method leads to instance-based interpretability of both the learned data representations and the relationship between channels. Motivated by our observations, we use CW-DeepNNK to propose a novel early stopping criterion that (i) does not require a validation set, (ii) is based on a task performance metric, and (iii) allows stopping to be reached at different points for each channel. Our experiments demonstrate that our proposed method has advantages as compared to the standard criterion based on validation set performance.

研究动机与目标

  • 解决在不依赖验证集的情况下确定深度学习最优训练停止时间的挑战。
  • 通过在通道级别分析中间激活,实现对学习特征表示的实例化可解释性。
  • 开发一种通道级泛化估计方法,捕捉每个卷积滤波器的独特贡献及其学习动态。
  • 提出一种基于局部性能自适应调整每通道训练时长的早停准则,提升效率与泛化能力。
  • 在不保留标注数据用于验证的前提下保持高测试准确率,尤其在低数据场景下具有优势。

提出的方法

  • 该方法在中间层激活的低维子向量(通道)上构建NNK图,实现基于局部多面体插值的泛化性能估计。
  • 使用NNK多面体上的留一法(LOO)分类性能作为每通道的泛化度量指标。
  • 当某通道的LOO性能不再提升时,应用通道级早停规则,实现各通道不同的停止时间。
  • 采用范围归一化的余弦和高斯核函数,提升在高维特征空间中的鲁棒性。
  • 以降低频率(例如每T个周期一次)执行LOO计算,以减少计算成本,同时保持性能。
  • 该框架兼容任意优化器,无需超参数调优或验证数据。

实验结果

研究问题

  • RQ1能否在不使用验证集的情况下,通过局部多面体插值有效估计通道级泛化性能?
  • RQ2与基于验证的标准方法相比,基于LOO性能的通道级早停是否能提升测试准确率并减少训练时间?
  • RQ3该方法能否通过将全部标注数据用于训练,在低数据场景下保持高性能?
  • RQ4LOO计算频率如何影响早停准则的效率与准确性?
  • RQ5该方法能否检测出预测能力较低的通道,从而为未来模型剪枝提供支持?

主要发现

  • 使用余弦核的CW-DeepNNK在测试准确率与训练迭代次数之间实现了最佳平衡,优于基于验证的早停方法和全向量DeepNNK。
  • 该方法在训练全部标注数据的前提下,保持或超过基于验证的早停方法的测试准确率,无需预留数据用于验证。
  • 将LOO计算频率降低至每10个周期一次,可在保持测试准确率和停止时间的同时,实现与基于验证方法相当的计算效率。
  • 在小样本设置(1000个样本)下,由于充分利用了全部数据,CW-DeepNNK的测试准确率高于基于验证的方法。
  • 该方法比标准方法更早检测到过拟合,可在不损失泛化性能的前提下实现更早停止。
  • 该方法支持通道级训练终止,部分通道在其他通道之前达到最优性能,表明不同滤波器存在不同的学习速率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。