[论文解读] Overwriting Pretrained Bias with Finetuning Data
本文研究了预训练模型中的偏差如何传递到微调模型,并证明通过调整虚假相关性或代表性不足问题,有针对性地筛选微调数据集,可以在性能损失最小的情况下有效消除预训练偏差。其核心贡献在于,微调数据集的调控为偏差缓解提供了一种实用且高影响力的替代方案,相较于修改大型预训练模型更具可行性。
Transfer learning is beneficial by allowing the expressive features of models pretrained on large-scale datasets to be finetuned for the target task of smaller, more domain-specific datasets. However, there is a concern that these pretrained models may come with their own biases which would propagate into the finetuned model. In this work, we investigate bias when conceptualized as both spurious correlations between the target task and a sensitive attribute as well as underrepresentation of a particular group in the dataset. Under both notions of bias, we find that (1) models finetuned on top of pretrained models can indeed inherit their biases, but (2) this bias can be corrected for through relatively minor interventions to the finetuning dataset, and often with a negligible impact to performance. Our findings imply that careful curation of the finetuning dataset is important for reducing biases on a downstream task, and doing so can even compensate for bias in the pretrained model.
研究动机与目标
- 探究在计算机视觉任务中,预训练模型中的偏差是否会传递到微调模型中。
- 评估通过有意识地筛选微调数据集,是否可以纠正微调模型中的偏差。
- 确定此类筛选是否能在保持高性能的同时减少偏差,尤其是在预训练模型本身存在偏差的情况下。
- 将微调数据集定位为相较于修改大型预训练数据集,更具实用性和有效性的干预点。
- 为从业者提供在下游任务中平衡性能与公平性的实用建议。
提出的方法
- 本研究采用两种偏差的实操化方式:敏感属性与目标任务之间的虚假相关性,以及数据集中某一群体的代表性不足。
- 针对虚假相关性,通过调整微调数据中相关性的强度(例如从20%提升至30%)来评估其对偏差和性能的影响。
- 针对代表性不足,通过调整微调数据集中代表性不足群体的正样本比例,以抵消偏差。
- 实验在CelebA、COCO和Dollar Street数据集上进行,使用了多种预训练模型,包括MoCo、SimCLR和自定义模型。
- 所有模型均经过完整微调(未冻结),性能通过下游任务上的公平性度量进行评估。
- 该方法聚焦于数据集层面的干预,而非架构或损失函数的修改,强调实用性和可扩展性。

实验结果
研究问题
- RQ1在存在虚假相关性的情况下,预训练模型的偏差在多大程度上传递给微调模型?
- RQ2通过调整微调数据集中相关性的强度,是否能减少偏差而不降低性能?
- RQ3调整微调数据中的类别分布以纠正代表性不足偏差,其有效性如何?
- RQ4在实用性和性能保留方面,微调数据集的筛选是否优于其他偏差缓解策略?
- RQ5是否可以有意识地对微调数据进行过度校正,以抵消测试集中存在的偏差?
主要发现
- 在基于有偏差的预训练模型进行微调时,模型会继承其偏差,尤其当虚假相关性强、显著或微调数据量有限时更为明显。
- 通过将微调数据中虚假相关性的强度从20%提高到30%,偏差几乎减半,同时保持了高性能。
- 通过调整微调数据集中代表性不足群体的比例,能有效纠正代表性不足偏差,且对性能影响可忽略。
- 微调数据集是偏差缓解的极佳干预点,通常优于修改预训练数据的努力。
- 即使预训练模型本身存在偏差,通过精心设计的微调数据集筛选,仍能使模型同时实现高性能与高公平性。
- 这些结果表明,在预训练数据无法更改的情况下,应优先考虑数据集筛选,尤其在对公平性要求较高的应用场景中。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。