Skip to main content
QUICK REVIEW

[论文解读] Robustness to Augmentations as a Generalization metric

Sumukh Aithal K, Dhruva Kashyap|arXiv (Cornell University)|Jan 16, 2021
Domain Adaptation and Few-Shot Learning参考文献 19被引用 7
一句话总结

本文提出了一种基于模型对数据增强的鲁棒性的深度学习模型泛化度量方法,认为对输入扰动具有鲁棒性的模型泛化能力更强。该方法通过惩罚在增强输入上的误分类来计算得分,对弱增强施加更高的惩罚;该方法在‘预测深度学习泛化能力’竞赛中获得第二名,展示了在CIFAR-10和SVHN数据集上的强大预测能力。

ABSTRACT

Generalization is the ability of a model to predict on unseen domains and is a fundamental task in machine learning. Several generalization bounds, both theoretical and empirical have been proposed but they do not provide tight bounds .In this work, we propose a simple yet effective method to predict the generalization performance of a model by using the concept that models that are robust to augmentations are more generalizable than those which are not. We experiment with several augmentations and composition of augmentations to check the generalization capacity of a model. We also provide a detailed motivation behind the proposed method. The proposed generalization metric is calculated based on the change in the output of the model after augmenting the input. The proposed method was the first runner up solution for the NeurIPS competition on Predicting Generalization in Deep Learning.

研究动机与目标

  • 为解决深度学习中模型泛化能力预测的挑战,现有度量方法常高估模型性能。
  • 开发一种实用且基于实证的泛化度量方法,与真实世界泛化能力具有强相关性。
  • 探究模型对数据增强的鲁棒性是否可作为泛化能力的可靠代理指标。
  • 评估不同增强方式——单独使用与组合使用——在度量模型泛化能力方面的有效性。
  • 提供一种简单但有效的度量方法,可适用于不同网络架构与训练策略。

提出的方法

  • 该方法通过评估每个训练样本在原始输入和增强输入上的模型预测,计算泛化度量ϕ。
  • 对于每个输入x,模型预测y = arg max Pθ(y|x),并对增强输入x′执行相同操作。
  • 若预测类别保持不变,则根据置信度分数的差异累积惩罚:|max Pθ(y|x) − Pθ(y|x′)|。
  • 若预测类别发生变化,则施加固定惩罚λ,其中弱增强(如翻转)使用更高的λ值,强增强(如Sobel滤波)使用更低的λ值。
  • 惩罚λ针对每种增强类型进行经验调优,包括组合增强如翻转 + 饱和度调整。
  • 最终度量聚合所有训练样本的惩罚值,得分越低(越负)表示泛化能力越差。

实验结果

研究问题

  • RQ1模型对数据增强的鲁棒性是否可作为深度神经网络泛化能力的可靠代理指标?
  • RQ2不同类型的增强(如弱增强,如翻转;强增强,如Sobel滤波)如何影响泛化度量的预测能力?
  • RQ3组合多个增强是否能提升度量预测泛化性能的能力?
  • RQ4不同增强方式对应的惩罚权重λ如何影响度量在未见数据上的表现?
  • RQ5该度量方法在实践中是否能超越现有的基于复杂度的泛化界?

主要发现

  • 该度量方法在竞赛排行榜上取得了公开分数41.8和私有分数10.6,排名第二。
  • 增强组合,特别是翻转 + 饱和度调整(λ = 12)表现最佳,表明存在协同效应。
  • 对弱增强(如翻转,λ = 6)施加更高的惩罚值比对强增强(如Sobel滤波,λ = 3)更有效,表明对形状保持变化的敏感性更能反映泛化能力。
  • 使用虚拟对抗扰动(λv = 3)提升了性能,表明对局部扰动的鲁棒性是强大的泛化信号。
  • Cutout增强(λ = 2)表现出正向但适中的影响,而随机擦除(λ = 0)无影响,表明其可能不是泛化能力的强指标。
  • 该度量在CIFAR-10和SVHN数据集上均表现出与实际泛化能力的强相关性,验证了其在多种模型架构与超参数设置下的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。