Skip to main content
QUICK REVIEW

[论文解读] Poisoning and Backdooring Contrastive Learning

Nicholas Carlini, Andreas Terzis|arXiv (Cornell University)|Jun 17, 2021
Adversarial Robustness in Machine Learning参考文献 40被引用 19
一句话总结

该论文表明,当在未经清理的互联网爬取数据集上进行训练时,像CLIP这样的多模态对比学习模型极易受到投毒攻击和后门攻击。通过仅注入0.01%的投毒数据(例如,在300万张图像的数据集中注入300张图像),攻击者即可通过小型补丁触发器引发误分类,而针对性攻击甚至仅需0.0001%的数据即可成功,暴露出自监督学习中存在严重的安全风险。

ABSTRACT

Multimodal contrastive learning methods like CLIP train on noisy and uncurated training datasets. This is cheaper than labeling datasets manually, and even improves out-of-distribution robustness. We show that this practice makes backdoor and poisoning attacks a significant threat. By poisoning just 0.01% of a dataset (e.g., just 300 images of the 3 million-example Conceptual Captions dataset), we can cause the model to misclassify test images by overlaying a small patch. Targeted poisoning attacks, whereby the model misclassifies a particular test input with an adversarially-desired label, are even easier requiring control of 0.0001% of the dataset (e.g., just three out of the 3 million images). Our attacks call into question whether training on noisy and uncurated Internet scrapes is desirable.

研究动机与目标

  • 调查在未经清理的互联网爬取数据集上训练的多模态对比学习模型是否可行遭受投毒和后门攻击。
  • 评估在对比学习中使用嘈杂且未经清理的数据是否会引入显著的安全漏洞。
  • 证明极低程度的数据投毒——远低于监督学习所需量级——即可成功操控模型行为。
  • 推动开发针对自监督和对比学习系统中数据投毒的自动化防御机制。

提出的方法

  • 将现有的投毒和后门攻击技术适配至对比学习范式,其中模型通过对比正样本对和负样本对来学习。
  • 将投毒样本注入训练数据集中,每个样本均包含一个微小且难以察觉的补丁(例如,16×16的棋盘图案)作为触发器。
  • 采用一致或随机的补丁放置策略,以评估不同攻击设置下的鲁棒性。
  • 使用标准训练流程,在大规模数据集(如Conceptual Captions和YFCC)的投毒版本上训练对比模型(如CLIP)。
  • 在干净输入上评估模型性能,并测试在后门和针对性投毒条件下的误分类率。
  • 利用现有的开源CLIP训练工具,仅对训练过程进行最小修改即可复现攻击。

实验结果

研究问题

  • RQ1能否在基于未经清理的互联网爬取数据集训练的对比学习模型上有效实施后门攻击?
  • RQ2成功操控对比学习模型行为所需的数据投毒量有多大?
  • RQ3在对比学习中使用嘈杂且未经清理的数据是否会提高数据投毒攻击的可行性与影响程度?
  • RQ4即使缺乏人工数据清洗,是否仍能以极低数据注入量执行针对性投毒攻击?
  • RQ5这些攻击对自监督模型在现实世界部署中的可信度有何影响?

主要发现

  • 对比模型的后门攻击仅需0.01%的训练数据被投毒,远低于监督学习中通常所需的1%。
  • 针对性投毒攻击可仅通过0.0001%的数据投毒即成功,显示出极高的数据注入效率。
  • 即使训练数据未经清理且来自互联网,攻击依然有效,且缺乏人工审查。
  • 模型在干净测试数据上保持高准确率,但在包含触发补丁的输入上表现出极高的误分类率。
  • 攻击可通过标准CLIP训练工具实际复现,无需对模型架构或算法进行任何修改。
  • 研究结果表明,当在未经清理的数据上训练时,对比学习模型的安全性在根本上已被破坏,亟需开发新型防御机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。