[论文解读] Fine-Tuning Is All You Need to Mitigate Backdoor Attacks
本文展示了微调——尤其是名为超微调(super-fine-tuning)的新方法——在保留模型效用并最小化计算成本的前提下,能有效消除机器学习模型中的后门。该方法在三种场景(基于编码器的、迁移学习的和独立的)中均表现出强大的防御性能,优于现有防御方法,并引入了“后门后遗症”(backdoor sequela)概念以衡量残余漏洞。
Backdoor attacks represent one of the major threats to machine learning models. Various efforts have been made to mitigate backdoors. However, existing defenses have become increasingly complex and often require high computational resources or may also jeopardize models' utility. In this work, we show that fine-tuning, one of the most common and easy-to-adopt machine learning training operations, can effectively remove backdoors from machine learning models while maintaining high model utility. Extensive experiments over three machine learning paradigms show that fine-tuning and our newly proposed super-fine-tuning achieve strong defense performance. Furthermore, we coin a new term, namely backdoor sequela, to measure the changes in model vulnerabilities to other attacks before and after the backdoor has been removed. Empirical evaluation shows that, compared to other defense methods, super-fine-tuning leaves limited backdoor sequela. We hope our results can help machine learning model owners better protect their models from backdoor threats. Also, it calls for the design of more advanced attacks in order to comprehensively assess machine learning models' backdoor vulnerabilities.
研究动机与目标
- 探究微调是否可作为机器学习模型中一种简单、有效且低成本的后门攻击防御方法。
- 解决现有防御方法计算成本高或损害模型效用的局限性。
- 提出一种新型微调策略——超微调,以增强在传统微调失效场景下的后门清除能力。
- 引入并评估“后门后遗症”概念,作为评估后门缓解后残余漏洞的新指标。
- 证明在基于编码器和迁移学习的场景中,微调可作为零成本防御,因其已是下游适应的必要步骤。
提出的方法
- 提出在预训练后对整个模型进行微调的常规微调方法,作为基于编码器场景中的有效防御手段。
- 引入超微调,一种受超收敛(super-convergence)启发的动态学习率策略,结合高初始学习率与衰减,以增强后门清除效果。
- 采用从高学习率开始的调度策略,以破坏后门模式,并随时间逐渐降低,以保留模型效用。
- 在传统微调不足以实现后门缓解的迁移学习和独立场景中应用超微调。
- 结合干净数据与受控训练重新训练模型,专注于消除后门触发器,同时不改变模型原始功能。
- 引入“后门后遗症”作为新指标,用于评估移除一个后门是否会增加对其他攻击(如成员推断攻击或重新注入攻击)的脆弱性。
实验结果
研究问题
- RQ1在基于编码器的机器学习模型中,常规微调能否有效清除后门?
- RQ2在迁移学习和独立场景中,与常规微调相比,超微调是否显著提升后门缓解性能?
- RQ3微调在清除后门的同时,能在多大程度上保持模型效用(即干净准确率)?
- RQ4与最先进后门防御方法相比,所提出的防御方法在降低攻击成功率和计算成本方面表现如何?
- RQ5后门清除对模型其他攻击的脆弱性有何影响?这一影响能否通过“后门后遗症”概念进行量化?
主要发现
- 在基于编码器的场景中,常规微调仅用一个训练周期便将STL10数据集上的攻击成功率从0.998降低至0.127,表明以极低代价实现了近乎完全的后门清除。
- 在迁移学习场景中,常规微调在100个周期内将攻击成功率从0.945降至0.221,而超微调在更少周期内实现更优结果且保持更高干净准确率。
- 在所有评估场景中,超微调在攻击成功率降低和模型效用保持方面均优于最先进防御方法。
- 所提方法保持了高干净准确率(例如,AC防御导致准确率下降0.672至0.582,而超微调仅造成极小程度退化),显示出强大的效用保持能力。
- 实证评估表明,超微调留下的“后门后遗症”极少,表明对成员推断和重新注入攻击的残余脆弱性极低。
- 本研究证明,在基于编码器和迁移学习的设置中,微调可作为零成本防御,因为其本就是模型适配的标准步骤。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。