Skip to main content
QUICK REVIEW

[论文解读] Label Poisoning is All You Need

Rishi D. Jha, Jonathan Hayase|arXiv (Cornell University)|Oct 29, 2023
Adversarial Robustness in Machine Learning被引用 4
一句话总结

该论文提出FLIP,一种新颖的仅标签后门攻击方法,通过仅污染训练标签成功毒化模型,在仅2%标签被污染的情况下,CIFAR-10数据集上实现99.4%的攻击成功率,且干净准确率仅下降1.8%。该方法利用数据集提炼中的轨迹匹配技术,训练模型学习将特定标签模式与目标类别关联,即使不修改输入图像也能实现。

ABSTRACT

In a backdoor attack, an adversary injects corrupted data into a model's training dataset in order to gain control over its predictions on images with a specific attacker-defined trigger. A typical corrupted training example requires altering both the image, by applying the trigger, and the label. Models trained on clean images, therefore, were considered safe from backdoor attacks. However, in some common machine learning scenarios, the training labels are provided by potentially malicious third-parties. This includes crowd-sourced annotation and knowledge distillation. We, hence, investigate a fundamental question: can we launch a successful backdoor attack by only corrupting labels? We introduce a novel approach to design label-only backdoor attacks, which we call FLIP, and demonstrate its strengths on three datasets (CIFAR-10, CIFAR-100, and Tiny-ImageNet) and four architectures (ResNet-32, ResNet-18, VGG-19, and Vision Transformer). With only 2% of CIFAR-10 labels corrupted, FLIP achieves a near-perfect attack success rate of 99.4% while suffering only a 1.8% drop in the clean test accuracy. Our approach builds upon the recent advances in trajectory matching, originally introduced for dataset distillation.

研究动机与目标

  • 探究当攻击者仅控制训练标签而非输入图像时,后门攻击是否可行。
  • 挑战一种假设:即当训练图像干净但标签由不可信第三方提供时,模型对后门攻击是安全的。
  • 开发一种实用且高效的仅标签后门攻击方法,在保持高干净准确率的同时实现近乎完美的攻击成功率。
  • 评估FLIP对当前最先进防御方法(包括SPECTRE、k-means和PCA)的鲁棒性。
  • 通过微调展示FLIP攻击在大型视觉Transformer上的可迁移性。

提出的方法

  • FLIP使用轨迹匹配技术,该技术最初用于数据集提炼,以学习一系列与期望标签分布对齐的模型权重。
  • 该方法在合成数据集上训练模型,其中每个样本由一张干净图像和一个被污染的标签组成,旨在诱导模型将标签模式与目标类别关联。
  • 标签污染通过基于预定义模式(如正弦、周期性、Turner触发器)将一部分训练标签重新分配给目标类别来实现,而不改变图像内容。
  • 攻击通过损失函数进行优化,该函数鼓励模型对中毒样本的预测轨迹收敛至目标标签,同时保持对干净数据的性能。
  • FLIP在多种架构(ResNet-32、ResNet-18、VGG-19、Vision Transformer)和数据集(CIFAR-10、CIFAR-100、Tiny-ImageNet)上进行评估,以衡量其泛化能力和可迁移性。
  • 该方法在微调场景下进行测试,即使用从ResNet或VGG-19模型生成的FLIP标签对预训练ViT进行微调,结果表明其具有强大的可迁移性。

实验结果

研究问题

  • RQ1是否可以通过仅污染标签而无需修改输入图像来成功实施后门攻击?
  • RQ2FLIP在实现近乎完美的中毒攻击成功率的同时,其保持高干净测试准确率的效率如何?
  • RQ3FLIP在面对SPECTRE、k-means和PCA等当前最先进防御方法时表现如何?
  • RQ4当从预训练模型微调时,FLIP生成的标签污染是否能有效迁移到大型视觉Transformer?
  • RQ5实现强攻击性能所需的最少标签污染数量是多少?

主要发现

  • 仅在CIFAR-10的2%标签被污染的情况下,FLIP实现了99.4%的中毒测试准确率(PTA),同时干净测试准确率(CTA)仅下降1.8%。
  • FLIP在PTA与CTA的权衡上优于现有基线方法,包括[18]中的多标签攻击和内积基线方法,尤其在低污染率下表现更优。
  • SPECTRE防御对FLIP极为有效,将PTA降低至各类触发器类型下的接近零,而k-means和PCA防御则无法缓解该攻击。
  • FLIP表现出强大的可迁移性:在ResNet-32或VGG-19模型上训练的标签,成功在微调至ImageNet1K的视觉Transformer上实现后门攻击,PTA超过94%,仅使用1,500个中毒标签。
  • 在FLIP中使用ℓ₁-正则化并未提升性能,表明其核心方法在标签效率和鲁棒性方面已达到最优。
  • 即使在SPECTRE等强防御下,FLIP在图像干净但标签不可信的场景(如众包标注和知识蒸馏)中仍构成威胁。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。