[论文解读] UNICORN: A Unified Backdoor Trigger Inversion Framework
UNICORN 提出了一种统一的后门触发器反演框架,通过在各种输入空间中利用可逆变换对触发器建模为扰动,实现了对多样化触发器类型的泛化。该方法在 CIFAR-10 和 ImageNet 上的八种后门攻击类型中均优于先前方法,在反演中实现了超过 95% 的攻击成功率,并在自监督模型上表现出有效性。
The backdoor attack, where the adversary uses inputs stamped with triggers (e.g., a patch) to activate pre-planted malicious behaviors, is a severe threat to Deep Neural Network (DNN) models. Trigger inversion is an effective way of identifying backdoor models and understanding embedded adversarial behaviors. A challenge of trigger inversion is that there are many ways of constructing the trigger. Existing methods cannot generalize to various types of triggers by making certain assumptions or attack-specific constraints. The fundamental reason is that existing work does not consider the trigger's design space in their formulation of the inversion problem. This work formally defines and analyzes the triggers injected in different spaces and the inversion problem. Then, it proposes a unified framework to invert backdoor triggers based on the formalization of triggers and the identified inner behaviors of backdoor models from our analysis. Our prototype UNICORN is general and effective in inverting backdoor triggers in DNNs. The code can be found at https://github.com/RU-System-Software-and-Security/UNICORN.
研究动机与目标
- 为解决现有触发器反演方法的局限性,即假设静态像素空间触发器,且无法泛化至滤波器或形变效应等复杂触发器。
- 通过可逆变换正式定义后门触发器为不同输入空间中的扰动,从而实现反演问题的统一建模。
- 识别并利用后门模型中良性与受损激活向量的解耦特性,作为反演的关键行为特征。
- 开发一种通用框架,可在无需依赖特定攻击假设的前提下,反演包括数据投毒攻击和供应链攻击在内的多种攻击类型的触发器。
- 通过在预训练编码器中反演触发器,将触发器反演的应用范围扩展至自监督学习模型。
提出的方法
- 将后门触发器形式化为变换输入空间中的扰动:$\tilde{\bm{x}} = \phi^{-1}\left((1-\bm{m})\odot\phi(\bm{x}) + \bm{m}\odot\bm{t}\right)$,其中 $\phi$ 为可逆变换函数。
- 提出一种约束优化问题,联合搜索输入空间变换 $\phi$、掩码 $\bm{m}$ 和触发器模式 $\bm{t}$,以重建后门触发器。
- 利用观察结果:后门模型中间层中的受损激活向量与良性向量实现了解耦,从而实现对后门行为的可靠检测。
- 采用基于 PyTorch 的原型 UNICORN,通过梯度搜索结合正则化求解优化问题,确保触发器小而不可察觉。
- 通过最大化反演触发器嵌入与参考样本嵌入之间的相似性,将框架适配至自监督模型,绕过分类损失。
- 采用基于参考样本的评估策略,自监督模型中通过微调下游分类器来衡量攻击成功率。
实验结果
研究问题
- RQ1是否能够设计一种统一的触发器反演框架,在无需依赖特定攻击假设的前提下,泛化至包括滤波器、形变效应和补丁型触发器在内的多样化触发器类型?
- RQ2通过可逆变换在不同输入空间中建模触发器,如何提升触发器反演的泛化能力与鲁棒性?
- RQ3后门模型中解耦的激活模式在多大程度上能实现对不同架构和数据集上触发器的可靠检测与反演?
- RQ4所提出的框架是否能有效反演自监督学习模型中的触发器,特别是在预训练编码器中?
- RQ5UNICORN 在多种数据集和后门攻击类型上的性能与先前最先进方法相比如何?
主要发现
- UNICORN 在 CIFAR-10 和 ImageNet 上的八种不同后门攻击中实现了平均 95.89% 的攻击成功率(ASR),显著优于假设静态像素空间触发器的先前方法。
- 在补丁攻击中,UNICORN 实现了 98.95% 的 ASR,较次佳方法高出超过 10 个百分点,展现出卓越的反演准确率。
- 对于使用复杂形变效应的 WaNet 攻击,UNICORN 实现了 91.41% 的 ASR,表明其在非传统、空间变换触发器上也具备有效性。
- 在自监督学习中,UNICORN 在预训练编码器中反演触发器的平均 ASR 达到 97.01%,与注入触发器的平均成功率(97.87%)极为接近。
- 该框架成功反演了 Badencoder 中的白色方形补丁触发器,反演结果在空间位置上与原始触发器一致,证实了空间保真度。
- UNICORN 的反演性能在多种模型(包括 ResNet、DenseNet 和视觉Transformer)上均表现稳健,表明其泛化能力超越特定架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。