Skip to main content
QUICK REVIEW

[论文解读] Black-box Backdoor Defense via Zero-shot Image Purification

Yucheng Shi, Mengnan Du|arXiv (Cornell University)|Mar 21, 2023
Generative Adversarial Networks and Image Synthesis被引用 5
一句话总结

本文提出零样本图像净化(Zero-shot Image Purification, ZIP),一种黑箱后门防御方法,通过应用图像变换(如模糊处理)破坏触发器模式,并利用预训练的扩散模型恢复语义内容,实现在无需模型访问或训练数据的情况下生成高保真度的净化图像。ZIP在不损害分类准确率的前提下,有效防御了多种后门攻击,在零样本设置下优于现有最先进基线方法。

ABSTRACT

Backdoor attacks inject poisoned samples into the training data, resulting in the misclassification of the poisoned input during a model's deployment. Defending against such attacks is challenging, especially for real-world black-box models where only query access is permitted. In this paper, we propose a novel defense framework against backdoor attacks through Zero-shot Image Purification (ZIP). Our framework can be applied to poisoned models without requiring internal information about the model or any prior knowledge of the clean/poisoned samples. Our defense framework involves two steps. First, we apply a linear transformation (e.g., blurring) on the poisoned image to destroy the backdoor pattern. Then, we use a pre-trained diffusion model to recover the missing semantic information removed by the transformation. In particular, we design a new reverse process by using the transformed image to guide the generation of high-fidelity purified images, which works in zero-shot settings. We evaluate our ZIP framework on multiple datasets with different types of attacks. Experimental results demonstrate the superiority of our ZIP framework compared to state-of-the-art backdoor defense baselines. We believe that our results will provide valuable insights for future defense methods for black-box models. Our code is available at https://github.com/sycny/ZIP.

研究动机与目标

  • 解决在无法获取模型内部信息和训练数据的情况下,防御黑箱机器学习模型免受后门攻击的挑战。
  • 开发一种在零样本设置下运行的防御框架,无需事先了解干净样本或中毒样本,也无需了解攻击类型。
  • 即使在使用中毒模型进行推理时,也保持净化图像的高分类准确率。
  • 实现在仅支持查询访问的现实世界机器学习即服务(MLaaS)场景中防御机制的实际部署。
  • 克服现有净化方法在面对非补丁型或分布型触发器时失效的局限性。

提出的方法

  • 对中毒输入应用线性图像变换(如模糊或灰度化),以破坏触发器模式。
  • 利用预训练的扩散生成模型,从变换后的输入重建图像,通过变换后的图像引导以保留语义内容。
  • 在扩散模型中设计一种新型逆去噪过程,通过条件化于变换图像来生成高保真、无触发器的输出。
  • 利用预训练扩散模型在自然图像分布上进行训练的事实,使其难以重建人为设计的触发器模式。
  • 采用两阶段流程:先通过变换破坏触发器,再通过扩散模型恢复语义完整性。
  • 应用如分块处理和基于检测的剪枝等加速策略,提升推理效率,实现最高达39倍的加速。

实验结果

研究问题

  • RQ1在无法访问模型权重或训练数据的情况下,防御框架能否有效从中毒图像中去除后门触发器?
  • RQ2预训练的扩散模型能否从变换后的(如模糊的)中毒图像中恢复语义内容,同时消除触发器模式?
  • RQ3所提出的零样本防御方法在使用中毒模型对净化图像进行推理时,是否能保持高分类准确率?
  • RQ4该防御方法对多种攻击类型(包括补丁型和非补丁型触发器)的有效性如何?
  • RQ5该防御方法能否在无需事先了解攻击方法或触发器模式的情况下,泛化到未见过的攻击场景?

主要发现

  • 在BadNets攻击下,ZIP实现了82.36%的干净准确率(CA)和18.47%的攻击成功率(ASR),显著优于现有最先进基线方法。
  • 在Blended攻击下,ZIP保持了81.63%的CA,并将ASR降低至28.83%,展现出对多种攻击类型的强泛化能力。
  • 通过分块处理实现了33倍加速,通过基于检测的剪枝实现了39倍加速,使净化速度在某些情况下快于分类。
  • 采用多种变换(如模糊+灰度化)提升了鲁棒性,当变换方式与攻击者不一致时,攻击即告失败。
  • 通过利用扩散模型对人工设计模式的分布不相容性,框架成功防御了增强型攻击,包括自适应触发器攻击。
  • ZIP保持了高保真度的图像重建,表现为高CA和低ASR,即使在分类器模型被中毒的情况下也依然有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。