[论文解读] ASSET: Robust Backdoor Data Detection Across a Multiplicity of Deep Learning Paradigms
ASSET 提出了一种新颖的主动后门检测方法,通过两级嵌套偏移循环主动诱导模型在干净样本与污染样本之间产生分歧行为,从而在端到端监督学习、自监督学习和迁移学习设置中实现稳健检测。该方法达到最先进性能,包括检测最先进的无标签后门攻击,并在自监督学习中检测率提升69.3%,在迁移学习中提升33.2%。
Backdoor data detection is traditionally studied in an end-to-end supervised learning (SL) setting. However, recent years have seen the proliferating adoption of self-supervised learning (SSL) and transfer learning (TL), due to their lesser need for labeled data. Successful backdoor attacks have also been demonstrated in these new settings. However, we lack a thorough understanding of the applicability of existing detection methods across a variety of learning settings. By evaluating 56 attack settings, we show that the performance of most existing detection methods varies significantly across different attacks and poison ratios, and all fail on the state-of-the-art clean-label attack. In addition, they either become inapplicable or suffer large performance losses when applied to SSL and TL. We propose a new detection method called Active Separation via Offset (ASSET), which actively induces different model behaviors between the backdoor and clean samples to promote their separation. We also provide procedures to adaptively select the number of suspicious points to remove. In the end-to-end SL setting, ASSET is superior to existing methods in terms of consistency of defensive performance across different attacks and robustness to changes in poison ratios; in particular, it is the only method that can detect the state-of-the-art clean-label attack. Moreover, ASSET's average detection rates are higher than the best existing methods in SSL and TL, respectively, by 69.3% and 33.2%, thus providing the first practical backdoor defense for these new DL settings. We open-source the project to drive further development and encourage engagement: https://github.com/ruoxi-jia-group/ASSET.
研究动机与目标
- 解决现有后门检测方法在多种深度学习范式(包括端到端监督学习(SL)、自监督学习(SSL)适应和迁移学习(TL))中缺乏泛化能力的问题。
- 识别现有检测方法的关键局限性——如在攻击类型、污染比例和学习范式之间泛化能力差,尤其在最先进的无标签后门攻击面前失效。
- 开发一种检测框架,可在不同攻击技术、污染比例和学习设置下保持高性能,包括先前方法失效或不适用的情况。
- 实现在新兴、数据高效学习范式(如SSL和TL)中的实用后门防御,这些场景目前尚无有效检测方法。
- 通过使用检测样本作为后处理防护措施的简单遗忘步骤,增强对自适应攻击的检测鲁棒性。
提出的方法
- 提出两级嵌套偏移循环,主动操控模型行为:外层循环调整模型决策边界以放大干净样本与污染样本之间的差异,内层循环则基于学习到的偏移量对模型进行微调以实现分离。
- 使用损失函数,通过在训练期间施加相反的偏移量,促使模型对干净样本与污染样本产生不同的输出,从而在模型内部表征中有效实现分离。
- 引入自适应程序,基于模型置信度和样本间预测的差异性,确定应移除的可疑样本最优数量。
- 利用后门模型的输出和中间激活值引导偏移优化过程,确保检测基于模型行为而非静态统计特性。
- 在自监督学习和迁移学习设置中,通过使用预训练嵌入器或冻结的特征提取器生成嵌入,将检测框架前置用于可疑样本识别。
- 通过在检测样本上使用反向梯度的后处理遗忘步骤,进一步降低后门影响,增强对自适应攻击的鲁棒性。
实验结果
研究问题
- RQ1现有后门检测方法是否能在包括端到端SL、SSL适应和TL在内的多种深度学习范式中保持一致性能?
- RQ2现有检测方法在使用不可察觉的特征级扰动且不改变标签的最先进的无标签后门攻击下表现如何?
- RQ3能否设计一种统一的检测框架,使其对污染比例、攻击类型和模型架构在多种学习范式下的变化具有鲁棒性?
- RQ4在尚未评估过任何先前检测方法的自监督学习和迁移学习设置中,哪些机制可实现稳健检测?
- RQ5如何使检测对自适应攻击具有鲁棒性,即攻击者通过修改触发器或模型行为来应对已知防御策略?
主要发现
- 现有后门检测方法无法检测到使用不可察觉的特征级扰动且不改变标签的最先进的无标签后门攻击。
- 在端到端SL中,所有现有方法在不同攻击和污染比例下表现不一致,极端比例下(如0.05%或20%)检测率显著下降。
- ASSET是唯一能在所有评估设置中检测无标签后门攻击的方法,展现出对这一先进威胁的独特鲁棒性。
- 在SSL设置中,ASSET的平均检测率比最佳现有方法高出69.3%,标志着该范式中首次实现有效的后门检测。
- 在TL设置中,ASSET的检测准确率比最佳先前方法提高33.2%,确立了该新兴学习场景中的首个实用防御方案。
- 当结合使用检测样本的遗忘步骤时,ASSET在白盒和灰盒自适应攻击下仍能保持高防御性能,即使在模型不匹配条件下亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。