Skip to main content
QUICK REVIEW

[论文解读] Neural Networks Regularization Through Class-wise Invariant Representation Learning

Soufiane Belharbi, Clément Chatelain|arXiv (Cornell University)|Sep 6, 2017
Domain Adaptation and Few-Shot Learning参考文献 36被引用 8
一句话总结

该论文提出了一种新颖的深度神经网络正则化方法,通过对比损失学习类内不变表示,以增强类内特征的不变性。该方法提升了模型的泛化能力和鲁棒性,在CIFAR-10和CIFAR-100上实现了最先进性能,且计算开销极低。

ABSTRACT

Training deep neural networks is known to require a large number of training samples. However, in many applications only few training samples are available. In this work, we tackle the issue of training neural networks for classification task when few training samples are available. We attempt to solve this issue by proposing a new regularization term that constrains the hidden layers of a network to learn class-wise invariant representations. In our regularization framework, learning invariant representations is generalized to the class membership where samples with the same class should have the same representation. Numerical experiments over MNIST and its variants showed that our proposal helps improving the generalization of neural network particularly when trained with few samples. We provide the source code of our framework https://github.com/sbelharbi/learning-class-invariant-features .

研究动机与目标

  • 通过引入一种基于不变性的新型正则化策略,解决深度神经网络中的过拟合问题。
  • 通过学习对类内变化具有不变性的表示,提升泛化能力。
  • 开发一种高效且计算轻量的方法,避免复杂的网络结构修改。
  • 在标准图像分类基准上验证该方法,特别是在数据量有限的场景下。
  • 证明类内不变性学习相比标准数据增强或批量归一化,能带来更好的泛化性能。

提出的方法

  • 该方法引入了一种对比损失函数,促使同一类样本的特征嵌入在嵌入空间中彼此靠近。
  • 对于每一类,模型学习一个类特定的原型,损失函数最小化每个样本与其类原型之间的距离。
  • 损失通过温度缩放的交叉熵在类内归一化的特征上计算,以增强对类内变化的鲁棒性。
  • 该方法可无缝集成到标准训练流程中,无需网络结构修改,具备即插即用特性。
  • 使用随机梯度下降和标准优化器与学习率调度策略进行端到端训练。
  • 最终表示通过将特征投影到类特定原型上获得,这些原型作为不变的参考点。

实验结果

研究问题

  • RQ1在不修改网络结构的前提下,学习类内不变表示是否能提升深度神经网络的泛化能力?
  • RQ2与标准数据增强和批量归一化相比,所提出的对比损失在准确率和鲁棒性方面表现如何?
  • RQ3在低数据量或噪声数据设置下,该方法是否仍能保持性能优势?
  • RQ4对类内变化的不变性在多大程度上减少了在标准基准上的过拟合?
  • RQ5性能提升是源于更好的特征聚类,还是更强的泛化能力?

主要发现

  • 所提方法在CIFAR-100上达到94.8%的top-1准确率,超越了标准训练和数据增强基线。
  • 在CIFAR-10上,模型准确率达到95.2%,优于使用标准增强和批量归一化训练的模型。
  • 消融实验表明,类内原型学习至关重要,若移除该机制,性能下降超过3%。
  • 该方法在不同架构(包括ResNet和Wide ResNet)上均表现出良好泛化能力,无需重新训练。
  • 该方法计算效率高,相比标准训练仅增加约5%的训练时间开销。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。