[论文解读] How Much Data Are Augmentations Worth? An Investigation into Scaling Laws, Invariance, and Implicit Regularization
本文通过缩放定律量化数据增强(DA)相对于真实数据的收益,探究其在深度学习中的作用机制。研究发现,由于引入的随机性和隐式正则化,数据增强在分布外泛化方面甚至比额外的真实数据更具价值,尤其在小样本数据集上,TrivialAug及其类似策略表现尤为出色。
Despite the clear performance benefits of data augmentations, little is known about why they are so effective. In this paper, we disentangle several key mechanisms through which data augmentations operate. Establishing an exchange rate between augmented and additional real data, we find that in out-of-distribution testing scenarios, augmentations which yield samples that are diverse, but inconsistent with the data distribution can be even more valuable than additional training data. Moreover, we find that data augmentations which encourage invariances can be more valuable than invariance alone, especially on small and medium sized training sets. Following this observation, we show that augmentations induce additional stochasticity during training, effectively flattening the loss landscape.
研究动机与目标
- 解耦数据增强提升模型泛化能力的机制,超越简单的数据扩展。
- 利用缩放定律量化增强数据与真实训练数据之间的交换率。
- 探究不变性是否足以解释数据增强的优势,还是随机性和隐式正则化也起关键作用。
- 评估增强对损失曲面平坦度及泛化的影响,尤其在分布偏移情况下的表现。
- 确定偏离数据分布的增强策略是否仍能提升性能,从而挑战关于标签保持变换的假设。
提出的方法
- 提出幂律模型,以验证准确率为代理指标,估算给定数量增强样本等效的真实数据样本数量。
- 采用缩放定律比较不同数据集规模下有无增强时的模型性能,拟合形式为 $ f(x) = ax^{-c} + b $ 的函数。
- 通过梯度噪声和曲率度量评估数据增强的正则化效果,衡量模型平坦度。
- 应用多种增强策略(如 TrivialAug、RandAug、AutoAug),并评估其对分布内与分布外泛化的影响。
- 在 CIFAR-10、CIFAR-10-C 和 ImageNet 上进行受控实验,以隔离增强对泛化和损失曲面几何的影响。
- 引入“交换率”概念,通过性能曲线的反向缩放定义增强数据与真实数据的价值比较。
实验结果
研究问题
- RQ1在分布偏移情况下,数据增强带来的性能提升与增加真实训练数据相比如何?
- RQ2不变性、随机性和隐式正则化在数据增强优势中分别起到多大程度的作用?
- RQ3与数据分布不一致的增强策略是否仍能提升模型泛化能力?
- RQ4数据增强如何影响损失曲面的平坦度?这与泛化提升是否相关?
- RQ5在不同模型架构和数据集上,增强样本与真实数据样本之间的有效交换率是多少?
主要发现
- 在 CIFAR-10-C 等分布外测试集上,产生多样化但分布不一致样本的增强策略,其价值可能超过额外的真实数据。
- 鼓励不变性的数据增强比仅依赖不变性更有效,尤其在小规模和中等规模训练集上。
- 增强在训练过程中引入额外随机性,导致损失曲面更平坦,从而提升泛化能力,这一现象通过梯度噪声和曲率度量得以验证。
- 增强数据与真实数据之间的交换率并非恒定:其随数据集规模增大而上升,且在增强策略优于任何数量真实数据时可能变为未定义(例如,CIFAR-10-C 上使用 TrivialAug)。
- TrivialAugment 及类似策略在小数据集上表现优异,表明其诱导了超越标准不变性的有效隐式正则化。
- 通过增强获得的有效样本数量与模型平坦度之间存在强相关性,但 TrivialAug 除外,其可能导致人为平坦的模型而无相应性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。