Skip to main content
QUICK REVIEW

[论文解读] Backdoor Defense via Adaptively Splitting Poisoned Dataset

Kuofeng Gao, Yang Bai|arXiv (Cornell University)|Mar 23, 2023
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文提出自适应分割防御(ASD),一种新颖的训练时后门防御方法,通过损失引导和元学习启发的分割策略,自适应地将污染数据集划分为干净数据池和污染数据池。ASD在多个基准测试中对六种最先进后门攻击展现出最先进水平的鲁棒性,同时保持了高干净准确率,其防御效果和效率均优于现有方法。

ABSTRACT

Backdoor defenses have been studied to alleviate the threat of deep neural networks (DNNs) being backdoor attacked and thus maliciously altered. Since DNNs usually adopt some external training data from an untrusted third party, a robust backdoor defense strategy during the training stage is of importance. We argue that the core of training-time defense is to select poisoned samples and to handle them properly. In this work, we summarize the training-time defenses from a unified framework as splitting the poisoned dataset into two data pools. Under our framework, we propose an adaptively splitting dataset-based defense (ASD). Concretely, we apply loss-guided split and meta-learning-inspired split to dynamically update two data pools. With the split clean data pool and polluted data pool, ASD successfully defends against backdoor attacks during training. Extensive experiments on multiple benchmark datasets and DNN models against six state-of-the-art backdoor attacks demonstrate the superiority of our ASD. Our code is available at https://github.com/KuofengGao/ASD.

研究动机与目标

  • 为解决在使用不可信第三方数据训练深度神经网络时面临的后门攻击这一关键挑战。
  • 通过实现对污染数据集的自适应、动态分割,改进现有训练时防御方法,将其划分为干净和污染数据池。
  • 通过在分割数据池上应用半监督学习,降低污染传播风险,同时保持模型性能。
  • 开发一种快速、端到端的防御机制,避免昂贵的微调,并最小化训练过程中的后门泄露。
  • 在多个数据集和模型上,展示对多样化后门攻击的优越鲁棒性,同时保持高干净准确率。

提出的方法

  • 通过将污染数据集划分为两个数据池(干净的(已标注)和污染的(未标注))提出统一的训练时后门防御框架。
  • 提出一种快速的损失引导分割方法,基于样本损失大小初始化数据池。
  • 开发一种新颖的元学习启发分割(meta-split)技术,以更有效地识别并隔离干净的难分类样本与污染样本。
  • 在两个分割数据池上应用半监督学习:在干净数据池上进行监督训练,在污染数据池上进行自训练,以保留语义特征。
  • 仅使用每类10个干净种子样本进行初始化,支持基于迁移的扩展,减少对大量干净数据的依赖。
  • 通过损失引导和元分割更新,动态调整数据池组成,以提升分离效果和鲁棒性。

实验结果

研究问题

  • RQ1能否通过将污染数据集划分为干净和污染数据池,建立统一的训练时后门防御框架?
  • RQ2如何有效分离仅靠损失难以区分的干净难分类样本与污染样本?
  • RQ3自适应分割策略能否在保持高干净准确率的同时提升防御鲁棒性?
  • RQ4与ABL和DBD等现有防御方法相比,所提出的ASD方法在准确率和攻击成功率方面表现如何?
  • RQ5该防御能否实现高效、端到端的部署,而无需昂贵的微调或对干净数据的先验知识?

主要发现

  • ASD在CIFAR-10、GTSRB、ImageNet和VGGFace2上的六种SOTA后门攻击中均达到最先进防御性能。
  • 在CIFAR-10上,ASD对BadNets攻击保持93.8%的干净准确率,对Blend攻击保持90.9%,显著优于ABL和DBD。
  • 在VGGFace2上对WaNet攻击,ASD实现53.0%的干净准确率和仅3.1%的攻击成功率,展现出强大的鲁棒性。
  • 元分割组件成功将干净难分类样本与污染样本分离,如与ABL和DBD相比的损失分布对比所示。
  • ASD通过在污染数据池上应用半监督学习,而非直接进行遗忘学习,有效降低了后门泄露风险。
  • 该防御方法高效且可扩展,仅需每类10个干净种子样本,适用于实际部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。