[论文解读] Drawing Multiple Augmentation Samples Per Image During Training Efficiently Decreases Test Error
本文提出通过增加数据增强的多重性——即在训练过程中为每个唯一图像抽取多个增强样本——来提升深度ResNets和NFNets的测试准确率。尽管在固定小批量大小下训练收敛速度变慢,但更高的增强多重性始终能提升泛化性能,在仅使用168,900次参数更新的情况下,使用NFNet-F5在ImageNet上实现了86.8%的top-1准确率,优于相同计算预算下的标准训练方法。
In computer vision, it is standard practice to draw a single sample from the data augmentation procedure for each unique image in the mini-batch. However recent work has suggested drawing multiple samples can achieve higher test accuracies. In this work, we provide a detailed empirical evaluation of how the number of augmentation samples per unique image influences model performance on held out data when training deep ResNets. We demonstrate drawing multiple samples per image consistently enhances the test accuracy achieved for both small and large batch training. Crucially, this benefit arises even if different numbers of augmentations per image perform the same number of parameter updates and gradient evaluations (requiring the same total compute). Although prior work has found variance in the gradient estimate arising from subsampling the dataset has an implicit regularization benefit, our experiments suggest variance which arises from the data augmentation process harms generalization. We apply these insights to the highly performant NFNet-F5, achieving 86.8$\%$ top-1 w/o extra data on ImageNet.
研究动机与目标
- 研究每个唯一图像的增强样本数量对深度学习测试准确率的影响。
- 分离数据增强引入的偏差与方差在泛化中的作用。
- 评估数据增强的优势是否源于梯度方差,或源于其引发的偏差梯度更新。
- 评估在固定计算预算下,增强多重性是否能提升性能,尤其是在大批次训练中。
- 验证增强多重性在SOTA模型(如NFNet-F5)上的有效性。
提出的方法
- 引入‘增强多重性’概念——即在每个小批量中为每个唯一图像抽取多个增强版本,同时调整小批量大小或唯一图像数量。
- 实施两种训练方案:一种为小批量大小逐渐增加(唯一图像数量固定),另一种为小批量大小固定(随着多重性增加,每个小批量中的唯一图像数量减少)。
- 在两种方案下训练深度ResNets和NFNets,比较测试准确率与收敛速度。
- 使用固定的总计算预算(例如112,600或225,200次参数更新)以隔离增强多重性对训练时长的影响。
- 对NFNets应用SAM正则化,以评估在强优化设置下的性能表现。
- 将结果与标准训练(增强多重性=1)以及文献中先前的SOTA模型进行比较。
实验结果
研究问题
- RQ1在深度ResNets中,增加每个唯一图像的增强样本数量是否能提升测试准确率?
- RQ2数据增强带来的泛化优势是源于梯度估计的偏差,还是源于增强引入的方差?
- RQ3当总参数更新次数保持恒定时,更高的增强多重性是否仍能带来性能提升?
- RQ4增强多重性与大批次训练及有限学习率之间有何相互作用?
- RQ5高增强多重性能否减少达到SOTA性能所需的训练轮次?
主要发现
- 将增强多重性从1提升至16,使NFNet-F5在ImageNet上的测试准确率提升0.4%,达到86.8%的top-1准确率,且无需额外数据。
- 即使在固定计算预算为112,600次参数更新的情况下,增强多重性16的准确率仍高于标准训练(多重性=1)的准确率。
- 在小批量大小固定的情况下,更高的增强多重性导致训练收敛更慢,但泛化性能显著提升,尤其在大批次设置中表现突出。
- 同一模型在增强多重性16下,仅用34个训练轮次(168,900次更新)即可达到86.8%的top-1准确率,而基线模型需要更多轮次且准确率更低。
- 对于使用SAM的NFNet-F3,增强多重性16在225,200次更新后达到86.45%的top-1准确率——与NFNet-F6基线相差仅0.05%,但计算量减少4倍,参数更少。
- 当同一图像的多个增强版本被采样于同一小批量内时,增强多重性带来的性能增益最为显著,而非跨小批量采样。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。