Skip to main content
QUICK REVIEW

[论文解读] Do deep nets really need weight decay and dropout?

Álex Hernández-García, Peter König|arXiv (Cornell University)|Feb 20, 2018
Advanced Neural Network Applications参考文献 10被引用 19
一句话总结

本文研究了在目标识别任务中,权重衰减和丢弃是否对深度神经网络真正必要。通过在 ImageNet、CIFAR-10 和 CIFAR-100 数据集上对 All-CNN 和 WRN 架构进行消融实验,结果表明,仅使用数据增强即可实现与同时使用权重衰减和丢弃的模型相当或更优的泛化性能,提示当应用强数据增强时,显式正则化可能为冗余。

ABSTRACT

The impressive success of modern deep neural networks on computer vision tasks has been achieved through models of very large capacity compared to the number of available training examples. This overparameterization is often said to be controlled with the help of different regularization techniques, mainly weight decay and dropout. However, since these techniques reduce the effective capacity of the model, typically even deeper and wider architectures are required to compensate for the reduced capacity. Therefore, there seems to be a waste of capacity in this practice. In this paper we build upon recent research that suggests that explicit regularization may not be as important as widely believed and carry out an ablation study that concludes that weight decay and dropout may not be necessary for object recognition if enough data augmentation is introduced.

研究动机与目标

  • 探究权重衰减与丢弃在深度卷积网络中泛化是否为必要条件。
  • 评估数据增强是否可作为显式正则化技术的充分替代方案。
  • 评估在不同架构与数据集上,移除权重衰减与丢弃后仍保持高性能的影响。
  • 比较数据增强与显式正则化在控制过拟合与提升测试准确率方面的有效性。
  • 通过证明在强数据增强下权重衰减与丢弃的冗余性,挑战其在传统方法中的依赖性。

提出的方法

  • 在 ImageNet、CIFAR-10 和 CIFAR-100 数据集上,对 All-CNN 和宽残差网络(WRN)架构进行消融研究。
  • 训练模型时启用或禁用权重衰减与丢弃,采用三种数据增强方案:轻度、重度和无增强。
  • 轻度增强包括水平翻转和 10% 的平移;重度增强包括仿射变换、亮度与对比度调整。
  • ImageNet 使用随机裁剪(128×128),无增强时使用中心裁剪。
  • 通过在 10 次随机轻度增强下对 softmax 后验概率取平均,报告测试准确率以确保评估稳健性。
  • 按原始论文报告的超参数进行优化,但承认当移除正则化后,最优学习率可能发生偏移。

实验结果

研究问题

  • RQ1在深度卷积网络中,通过权重衰减与丢弃实现的显式正则化是否为泛化所必需?
  • RQ2仅使用数据增强是否可实现与同时使用权重衰减与丢弃的模型相当或更优的泛化性能?
  • RQ3在不同数据增强水平下,无显式正则化的模型性能与有正则化的模型相比如何?
  • RQ4数据增强的有效性是否依赖于模型架构或数据集规模?其与超参数调优后的显式正则化相比表现如何?
  • RQ5在不造成性能下降的前提下,权重衰减与丢弃的益处是否可被数据增强完全替代?

主要发现

  • 仅使用数据增强即可实现与同时使用权重衰减与丢弃的模型相当或更优的性能,尤其在 All-CNN 上表现显著。
  • 在 CIFAR-10 和 CIFAR-100 上使用 WRN 时,无正则化的模型测试准确率分别仅比带正则化的基线模型低 0.13% 和 0.28%,表明无显著性能增益。
  • 在超参数未优化的情况下(如 All-CNN 在 CIFAR-100 上),无正则化的模型反而优于使用权重衰减与丢弃的模型,表明对超参数选择更具鲁棒性。
  • 作者观察到,当移除正则化后,使用更高学习率可提升性能,提示原始超参数在缺乏显式正则化时可能并非最优。
  • 数据增强比权重衰减与丢弃更具适应性,且对超参数调优更不敏感,后者需针对不同架构与数据集进行精细调整。
  • 结果支持如下假设:与权重衰减和丢弃不同,数据增强不会降低模型容量,可作为更有效且充分的正则化形式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。