Skip to main content
QUICK REVIEW

[论文解读] Backdoor Attacks to Pre-trained Unified Foundation Models

Zenghui Yuan, Yixin Liu|arXiv (Cornell University)|Feb 18, 2023
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文首次针对预训练统一基础模型开展后门攻击的可行性研究,采用数据 poisoning 方法。结果表明,可成功将触发器注入多模态模型(如 OFA-tiny),在视觉任务中实现 96.34% 的攻击成功率,在自然语言处理任务中实现 100% 的成功率,同时保持较高的干净准确率,揭示了统一人工智能系统中的关键安全漏洞。

ABSTRACT

The rise of pre-trained unified foundation models breaks down the barriers between different modalities and tasks, providing comprehensive support to users with unified architectures. However, the backdoor attack on pre-trained models poses a serious threat to their security. Previous research on backdoor attacks has been limited to uni-modal tasks or single tasks across modalities, making it inapplicable to unified foundation models. In this paper, we make proof-of-concept level research on the backdoor attack for pre-trained unified foundation models. Through preliminary experiments on NLP and CV classification tasks, we reveal the vulnerability of these models and suggest future research directions for enhancing the attack approach.

研究动机与目标

  • 研究统一基础模型在多种模态和任务中对后门攻击的脆弱性。
  • 探索数据 poisoning 是否能有效在预训练模型中植入可泛化于视觉与自然语言处理任务的后门。
  • 评估无需下游任务特定知识即可在微调过程中持续存在的通用后门攻击的可行性。
  • 识别在异构模态间触发器设计与有效性方面面临的关键挑战。
  • 为未来在统一基础模型中开展通用后门攻击与防御研究奠定基础。

提出的方法

  • 采用数据 poisoning 范式,在预训练阶段将后门注入预训练的统一基础模型。
  • 设计混合触发器用于视觉与自然语言处理任务:在视觉任务中,将 'hello kitty' 图像以 20% 透明度混合,并在右下角粘贴红色方块;在自然语言处理任务中,插入稀有字符 'cf' 作为触发器。
  • 使用 OFA-tiny 模型作为图像与文本分类任务的基准模型。
  • 采用标准 OFA 训练流程,结合污染数据进行训练,使触发器嵌入训练样本中,训练模型将触发器与目标标签关联。
  • 采用干净准确率(CA)与攻击成功率(ASR)作为评估指标,衡量模型在干净输入与污染输入上的性能表现。
  • 在 CIFAR-10(视觉)与 SST-2(自然语言处理)数据集上进行实验,污染比例 ρ = 0.2。

实验结果

研究问题

  • RQ1能否通过数据 poisoning 有效攻击支持多模态与多任务的统一基础模型?
  • RQ2在不同模态中,不同触发器类型(视觉任务中的混合 vs. 粘贴,自然语言处理任务中的字符插入)在实现高攻击成功率方面的有效性如何?
  • RQ3后门在保持干净输入高性能的同时,能在多大程度上隐藏以逃避检测?
  • RQ4单一后门触发器是否可在无需任务特定适配的情况下,对多样化下游任务与模态均保持有效?
  • RQ5设计统一基础模型通用触发器的关键挑战是什么?

主要发现

  • 后门注入后,模型的干净准确率几乎未受影响,在 CIFAR-10 上为 91.35%,在 SST-2 上为 91.68%,表明对正常功能影响极小。
  • 基于混合的触发器在 CIFAR-10 数据集上实现了 96.34% 的攻击成功率(ASR),表明在视觉任务中具有高度有效性。
  • 基于粘贴的触发器在 CIFAR-10 上仅实现 85.13% 的 ASR,表明数据增强可能使触发器模糊或退化。
  • 在 SST-2 的自然语言处理任务中,攻击实现了完美的 100% ASR,表明 'cf' 字符触发器在文本输入中极为有效。
  • 结果证实,即使缺乏对下游任务或模态的先验知识,统一基础模型也易受通用后门攻击影响。
  • 本研究揭示,触发器设计及其对数据增强的鲁棒性是决定攻击成功率的关键因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。