[论文解读] On the Connection between Pre-training Data Diversity and Fine-tuning Robustness
本文研究了预训练数据多样性对微调鲁棒性的影响,发现数据量和标签粒度是分布偏移下鲁棒泛化的主导因素。以 iWildCam-WILDS 为基准,结果表明,当数据量保持不变时,增加预训练数据规模可显著提升鲁棒性,而标签语义、图像多样性及数据来源的影响则较小。
Pre-training has been widely adopted in deep learning to improve model performance, especially when the training data for a target task is limited. In our work, we seek to understand the implications of this training strategy on the generalization properties of downstream models. More specifically, we ask the following question: how do properties of the pre-training distribution affect the robustness of a fine-tuned model? The properties we explore include the label space, label semantics, image diversity, data domains, and data quantity of the pre-training distribution. We find that the primary factor influencing downstream effective robustness (Taori et al., 2020) is data quantity, while other factors have limited significance. For example, reducing the number of ImageNet pre-training classes by 4x while increasing the number of images per class by 4x (that is, keeping total data quantity fixed) does not impact the robustness of fine-tuned models. We demonstrate our findings on pre-training distributions drawn from various natural and synthetic data sources, primarily using the iWildCam-WILDS distribution shift as a test for downstream robustness.
研究动机与目标
- 理解预训练数据属性如何影响下游模型在自然分布偏移下的鲁棒性。
- 分离数据量、标签粒度、标签语义、图像多样性及数据来源对微调模型性能的影响。
- 在控制预训练数据量的前提下,评估合成数据与自然数据源是否能带来相当的鲁棒性增益。
- 确定鲁棒性泛化更多由数据分布特征驱动,还是由模型架构和训练方法决定。
- 为构建能增强对现实世界分布偏移鲁棒性的有效预训练数据集,提供以数据为中心的指导原则。
提出的方法
- 在 ImageNet、iNaturalist 和合成数据(如分形图像、Stable Diffusion 生成图像)的受控子集上预训练视觉模型,每次仅改变一个属性,其余保持不变。
- 在 iWildCam-WILDS 数据集上微调所有模型,该数据集是自然分布偏移的基准,使用分布外(OOD)分割的 F1 分数评估鲁棒性。
- 系统性地消融五个维度:数据量、标签粒度(粗粒度 vs. 细粒度)、标签语义(动物类 vs. 非生物类)、图像多样性(每类子类变化)以及数据来源(ImageNet、iNaturalist、合成数据)。
- 使用在 YFCC-15M 和 LAION-15M 上预训练的自监督 CLIP 模型,验证不同预训练目标和数据规模下的发现。
- 将结果与从零开始训练及 ImageNet 预训练的结果进行比较,建立鲁棒性随数据量变化的基线线性趋势。
- 在多种模型架构和预训练方法上分析结果,以评估发现的泛化能力。

实验结果
研究问题
- RQ1预训练数据量如何影响下游任务中分布偏移下微调模型的鲁棒性?
- RQ2在不考虑数据量的前提下,标签粒度(粗粒度 vs. 细粒度)在多大程度上影响下游鲁棒性?
- RQ3预训练类别之间的语义相似性(如动物类 vs. 非生物类)是否会影响向下游任务的迁移鲁棒性?
- RQ4增加每类图像多样性(如包含更多子类)如何影响微调模型的鲁棒性?
- RQ5在控制预训练数据量的前提下,合成数据源(分形或 Stable Diffusion 生成)能否实现与自然数据相当的鲁棒性?
主要发现
- 使用更多数据进行预训练可显著提升下游鲁棒性,即使仅使用 ImageNet 或 iNaturalist 中的 25K 张图像(仅为微调数据集的六分之一)也能带来明显的鲁棒性增益。
- 将标签粒度从 1000 个类别减少到 5 个类别会对鲁棒性产生可测量的负面影响,但其影响程度远低于减少数据量。
- 在 ImageNet 上预训练 600 个非生物类类别可实现与预训练 400 个动物类类别相当的有效鲁棒性,尽管下游任务聚焦于动物识别。
- 在数据量和标签集保持不变的前提下,增加每类图像多样性(如包含更多子类)对微调模型鲁棒性无显著影响。
- 当总数据量保持不变时,增加类别数量与增加每类图像数量之间的权衡可忽略不计,表明数据量在鲁棒性中占主导地位,而非类别多样性。
- 在相同数据量下,合成分形数据的效果不如自然数据,但 Stable Diffusion 生成的图像显著缩小了差距,并在数据量充足时表现与自然数据相当。
![Figure 2 : Effective robustness is defined as movement towards a classifier which is robust to distribution shift (i.e., line $y=x$ ). Using this metric, Miller et al. [ 26 ] observes that for the iWildCam-WILDS task, models pre-trained on ImageNet are much more robust than models trained from scrat](https://ar5iv.labs.arxiv.org/html/2307.12532/assets/x2.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。