[论文解读] A Scaling Law for Synthetic-to-Real Transfer: How Much Is Your Pre-training Effective?
本文提出了一种缩放定律,可根据预训练数据规模预测合成数据到真实数据(syn2real)迁移的性能,使研究人员能够评估增加合成数据是否能提升真实世界模型的性能。该定律表达为测试误差 ≈ Dn⁻ᵅ + C,揭示了泛化误差随数据量(n)增加而减少,但受迁移差距(C)限制,且在多种任务和模型架构中得到实证验证。
Synthetic-to-real transfer learning is a framework in which a synthetically generated dataset is used to pre-train a model to improve its performance on real vision tasks. The most significant advantage of using synthetic images is that the ground-truth labels are automatically available, enabling unlimited expansion of the data size without human cost. However, synthetic data may have a huge domain gap, in which case increasing the data size does not improve the performance. How can we know that? In this study, we derive a simple scaling law that predicts the performance from the amount of pre-training data. By estimating the parameters of the law, we can judge whether we should increase the data or change the setting of image synthesis. Further, we analyze the theory of transfer learning by considering learning dynamics and confirm that the derived generalization bound is consistent with our empirical findings. We empirically validated our scaling law on various experimental settings of benchmark tasks, model sizes, and complexities of synthetic images.
研究动机与目标
- 为解决增加合成数据用于预训练却无法提升真实世界性能的问题,其原因在于领域差距。
- 开发一种实用的、基于数据的方法,在进行大规模计算之前评估合成预训练的有效性。
- 从理论和实证两方面验证一个建模 syn2real 迁移学习中泛化误差的缩放定律。
- 提供一个决策框架,根据估计的参数判断应扩大数据规模还是重新配置合成数据生成方式。
提出的方法
- 提出缩放定律:测试误差 ≈ Dn⁻ᵅ + C,其中 D > 0,α > 0,且 C ≥ 0,D 和 α 反映收敛速度,C 代表领域差距。
- 通过多个基准任务(如 MS-COCO、ADE20K、ImageNet)和不同模型规模,对测试误差进行经验拟合。
- 利用神经正切核(NTK)理论推导迁移学习的一般化边界,将理论动态与实证发现联系起来。
- 在再生核希尔伯特空间(RKHS)中应用随机递归分析,以界定估计误差并推广该缩放定律。
- 从部分预训练数据中估计模型参数(α、C、D),以预测更大规模合成数据集带来的性能提升。
- 在多种设置下验证该定律:目标检测、语义分割、表面法线估计以及多标签分类。
实验结果
研究问题
- RQ1在视觉任务中,增加合成预训练数据在多大程度上能提升真实世界性能?
- RQ2一个简单的缩放定律是否能准确预测在多样化任务和模型架构中 syn2real 迁移的泛化误差?
- RQ3领域差距(C)在多大程度上限制了通过增加合成数据带来的性能提升?
- RQ4基于 NTK 理论的理论一般化边界与 syn2real 迁移中的实证观察在多大程度上一致?
- RQ5在什么情况下应增加数据规模,而非重新配置合成数据生成方式以提升性能?
主要发现
- 所提出的缩放定律测试误差 ≈ Dn⁻ᵅ + C 在多样化任务、模型规模和合成数据复杂度下均能准确预测性能。
- 迁移差距 C ≥ 0 决定了测试误差的下限,表明即使使用无限量的合成数据,也无法弥补过大的领域差距。
- 实证验证表明,该定律能以高精度拟合观测到的测试误差,如图1所示,在四个预训练和三个微调任务中均得到验证。
- 基于神经正切核的理论分析证实,该缩放行为与学习动态和一般化边界一致。
- 从部分数据中估计 α 和 C 可使研究人员预测进一步预训练是否能带来性能增益,或是否应重新配置数据生成。
- 研究表明,当领域差距较大(即 C 较大)时,增加数据规模带来的收益递减,验证了提升合成数据质量而非数量的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。