Skip to main content
QUICK REVIEW

[论文解读] When does Bias Transfer in Transfer Learning?

Hadi Salman, Saachi Jain|arXiv (Cornell University)|Jul 6, 2022
Domain Adaptation and Few-Shot Learning被引用 14
一句话总结

本文表明,即使目标数据集经过刻意去偏处理,预训练源模型(如 ImageNet)中的偏差仍会迁移至下游任务。通过合成后门攻击和自然存在的虚假相关性,作者证明微调后的模型仍保留源模型的偏差,挑战了通过精心数据整理可消除迁移学习中偏差的假设。

ABSTRACT

Using transfer learning to adapt a pre-trained "source model" to a downstream "target task" can dramatically increase performance with seemingly no downside. In this work, we demonstrate that there can exist a downside after all: bias transfer, or the tendency for biases of the source model to persist even after adapting the model to the target class. Through a combination of synthetic and natural experiments, we show that bias transfer both (a) arises in realistic settings (such as when pre-training on ImageNet or other standard datasets) and (b) can occur even when the target dataset is explicitly de-biased. As transfer-learned models are increasingly deployed in the real world, our work highlights the importance of understanding the limitations of pre-trained source models. Code is available at https://github.com/MadryLab/bias-transfer

研究动机与目标

  • 调查预训练源模型中的偏差在微调后是否仍存在于下游任务中。
  • 确定当目标数据集被明确去偏以消除虚假相关性时,偏差迁移是否仍会发生。
  • 评估训练动态、源数据集构成和目标数据分布对偏差迁移程度的影响。
  • 证明偏差迁移不仅限于合成后门,也通过自然存在的特征(如年龄预测中的性别)发生。
  • 强调在广泛使用的迁移学习流程中偏差迁移的现实影响,尤其是在依赖公开预训练模型时。

提出的方法

  • 通过在部分图像中添加触发器(如圆形黄色形状)并翻转其标签,在源数据集中植入偏差,实施合成后门攻击。
  • 使用随机梯度下降(SGD)在目标数据集上微调源模型,以源模型权重作为初始化。
  • 通过限制梯度更新至目标数据点的子空间,分析模型行为,从而保留与目标数据子空间正交的源模型偏差。
  • 通过筛选强化虚假相关性的图像(如 CelebA 中的性别与年龄),构建自然偏差数据集,以测试此类偏差的可迁移性。
  • 将从有偏差的 ImageNet 源模型微调的模型与在目标数据集(如 CIFAR-10)上从零开始训练的模型进行比较,以隔离偏差迁移效应。
  • 通过在测试图像上叠加触发器(如网球)并测量预测分布的变化,评估偏差。

实验结果

研究问题

  • RQ1在微调过程中,植入源数据集的偏差在多大程度上传播至目标任务?
  • RQ2当目标数据集被明确去偏以消除虚假相关性时,偏差迁移是否仍会发生?
  • RQ3训练流程、源数据集构成和目标数据集分布如何影响偏差迁移的幅度?
  • RQ4偏差迁移是否通过自然存在的特征而非合成触发器发生?
  • RQ5即使目标数据集不包含此类偏差,标准预训练模型(如 ImageNet)中的偏差是否仍可在下游模型中检测到?

主要发现

  • 即使目标数据集被明确去偏,偏差迁移仍会发生,表现为从有偏差源模型微调的模型对虚假特征仍保持敏感。
  • 从预训练 ImageNet 模型微调的模型在接触触发器(如圆形黄色形状)时,预测分布出现显著偏斜,而从零开始在 CIFAR-10 上训练的模型则不受影响。
  • 源模型在检测到圆形黄色形状时对“网球”进行预测的偏差,会迁移至下游任务,表现为微调模型的预测分布显著偏斜。
  • 即使采用固定特征微调,ImageNet 源模型的偏差仍保留在下游分类器中,表明偏差未在特征提取阶段被消除。
  • 全网络微调过程也保留了源模型的偏差,证实梯度更新无法消除与目标数据子空间正交的偏差。
  • 该现象不仅限于合成触发器:在 ImageNet 上预训练的模型对自然存在的相关性(如年龄预测中的性别)表现出敏感性,且这些相关性会迁移至下游任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。