[论文解读] Neural Polarizer: A Lightweight and Effective Backdoor Defense via Purifying Poisoned Features
本文提出 Neural Polarizer,一种轻量级后门防御方法,通过在后门模型中插入可学习的线性变换层,以过滤触发器特征,同时保留良性特征。该方法通过求解双层优化问题,在无需微调整个模型的前提下净化中毒输入,仅需极少的干净数据和较低的计算成本,实现了最先进的防御性能。
Recent studies have demonstrated the susceptibility of deep neural networks to backdoor attacks. Given a backdoored model, its prediction of a poisoned sample with trigger will be dominated by the trigger information, though trigger information and benign information coexist. Inspired by the mechanism of the optical polarizer that a polarizer could pass light waves with particular polarizations while filtering light waves with other polarizations, we propose a novel backdoor defense method by inserting a learnable neural polarizer into the backdoored model as an intermediate layer, in order to purify the poisoned sample via filtering trigger information while maintaining benign information. The neural polarizer is instantiated as one lightweight linear transformation layer, which is learned through solving a well designed bi-level optimization problem, based on a limited clean dataset. Compared to other fine-tuning-based defense methods which often adjust all parameters of the backdoored model, the proposed method only needs to learn one additional layer, such that it is more efficient and requires less clean data. Extensive experiments demonstrate the effectiveness and efficiency of our method in removing backdoors across various neural network architectures and datasets, especially in the case of very limited clean data.
研究动机与目标
- 解决现有后训练后门防御方法对大量干净数据和高计算成本的依赖问题。
- 开发一种可选择性过滤后门触发器特征、同时保留良性特征表示的防御机制。
- 通过仅学习一个额外层来最小化模型微调,降低计算开销。
- 在低数据场景下确保鲁棒性,尤其在仅有少量干净样本时表现优异。
- 启发一种新型轻量级、模块化防御层范式,不改变原始模型参数。
提出的方法
- 将可学习的神经极化器作为中间层插入后门模型中,作为特征过滤器,以抑制与触发器相关的激活。
- 神经极化器通过使用 1×1 卷积层后接批量归一化,实例化为轻量级线性变换。
- 构建双层优化框架:上层优化极化器以最小化后门成功率并最大化良性准确率,下层利用模型置信度估计目标标签。
- 通过有目标的对抗性扰动近似触发器,以在训练期间模拟中毒输入。
- 仅更新极化器的参数,保持后门模型中所有其他层固定,确保高效性。
- 使用有限的干净数据集进行防御训练,使其在干净数据稀缺的实际部署场景中具有实用性。
实验结果
研究问题
- RQ1一个轻量级可学习层是否能有效净化后门模型中的中毒特征,而无需微调整个网络?
- RQ2当仅有少量干净样本时,该方法的性能表现如何?
- RQ3神经极化器是否能在多种攻击类型和网络架构下,同时保持高良性准确率并显著降低后门成功率?
- RQ4在低数据和高复杂度设置下,与现有后训练防御方法相比,该方法在效率和鲁棒性方面表现如何?
- RQ5双层优化框架是否能在无触发器或标签直接访问的情况下,有效学习极化器?
主要发现
- 在 CIFAR-10 与 ResNet-18 上,该方法仅使用 500 个干净样本即实现了 94.09% 的防御效果(DER),优于 i-BAU 和 ANP。
- 仅使用 50 个干净样本时,该方法在 BadNets-A2O 上仍保持 92.37% 的 DER,展现出强大的低数据鲁棒性。
- 在 PreActResNet18 上,该方法在 50 个周期内耗时 55.16 秒,优于 i-BAU(57.23 秒,5 个周期)及其他基线方法,速度更快。
- 在 WaNet 攻击下,该方法使用 250 个干净样本实现了 97.12% 的 DER,显著优于 i-BAU(88.29%)和 ANP(80.17%)在相同条件下的表现。
- 该方法在不同中毒比例下表现稳定,随着中毒比例增加,准确率仅轻微下降,表明对数据污染水平具有强韧性。
- 该防御在将后门成功率降低至 2% 以下的同时,保持了高良性准确率(例如在 BadNets-A2O 上使用 500 个干净样本时达到 87.58%),证明了其在后门缓解方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。