Skip to main content
QUICK REVIEW

[论文解读] Constrained Optimization with Dynamic Bound-scaling for Effective NLPBackdoor Defense

Guangyu Shen, Yingqi Liu|arXiv (Cornell University)|Feb 11, 2022
Adversarial Robustness in Machine Learning被引用 11
一句话总结

本文提出一种用于NLP后门防御的动态边界缩放优化方法,通过在标记嵌入上使用温度调度的Softmax进行触发器反演。通过逐步降低温度以锐化损失景观,并采用回滚机制逃离局部最优解,该方法能有效检测并移除后门,在1,600多个模型、3项任务和4种攻击类型上,检测准确率比基线最高提升43.4%。

ABSTRACT

We develop a novel optimization method for NLPbackdoor inversion. We leverage a dynamically reducing temperature coefficient in the softmax function to provide changing loss landscapes to the optimizer such that the process gradually focuses on the ground truth trigger, which is denoted as a one-hot value in a convex hull. Our method also features a temperature rollback mechanism to step away from local optimals, exploiting the observation that local optimals can be easily deter-mined in NLP trigger inversion (while not in general optimization). We evaluate the technique on over 1600 models (with roughly half of them having injected backdoors) on 3 prevailing NLP tasks, with 4 different backdoor attacks and 7 architectures. Our results show that the technique is able to effectively and efficiently detect and remove backdoors, outperforming 4 baseline methods.

研究动机与目标

  • 解决NLP模型中后门检测与移除的挑战,因结构化和改写型触发器导致后门日益隐蔽。
  • 克服现有NLP后门反演方法的局限性,这些方法因标记空间的离散性和稀疏性而失效。
  • 开发一种稳健的优化框架,即使在复杂、自适应攻击下也能可靠定位真实触发器。
  • 在对干净数据的准确率损失最小的前提下实现有效的后门移除,确保在真实NLP系统中的实际部署。

提出的方法

  • 将触发器反演重新表述为在标记嵌入凸包上进行优化,其中每个点代表词汇表中所有标记的加权和。
  • 使用温度调度的Softmax动态控制优化输出的置信度,从高温度开始以实现广泛探索,随后降低温度以聚焦于类似one-hot的解。
  • 引入温度回滚机制,当优化器陷入局部最优时提高温度,利用仅全局最优解能产生低反演损失的特性。
  • 定义一个损失函数,衡量在反演触发器下模型的误分类程度,目标是最小化该损失以识别真实触发器。
  • 通过使用反演触发器对模型进行再训练或微调,将该方法应用于后门检测与移除。
  • 基于反演损失阈值采用回溯策略,以区分全局(真实触发器)和局部(虚假)最优解。

实验结果

研究问题

  • RQ1与固定温度方法相比,Softmax中的动态温度缩放是否能提升离散NLP空间中触发器反演的收敛性?
  • RQ2在NLP后门反演过程中,当真实触发器未被立即找到时,温度回滚机制在逃离局部最优解方面的有效性如何?
  • RQ3该方法在应对高级自适应攻击(如SOS和Combination Lock)时,检测与移除后门的能力在多大程度上仍有效,这些攻击会降低触发器的可见性?
  • RQ4在不同架构和任务下,该方法与最先进基线(如ASCC、UAT、T-Miner、遗传算法)相比,在检测准确率和鲁棒性方面表现如何?
  • RQ5在后门移除后,该方法是否能在将攻击成功率降至接近零的同时,保持较高的干净数据准确率?

主要发现

  • 当β=0.3时,该方法在Hidden Killer和Combination Lock攻击中分别实现了0.95和1.00的检测准确率,优于所有基线。
  • 对于自适应SOS攻击,该方法在β=1时仍保持0.875的检测准确率,展现出对隐蔽且损失优化触发器的强韧性。
  • 后门移除将TrojAI数据集上的平均攻击成功率(ASR)从0.987降至0.058,同时干净准确率仅出现轻微下降(如情感分析中从0.909降至0.892)。
  • 消融实验证实,温度缩放和回溯策略均至关重要:移除任一均显著降低检测性能。
  • 即使在触发器损失阈值(ϕ)提高的自适应攻击下,该方法仍保持有效,在ϕ=0.5时检测准确率仍超过80%,尽管ASR显著下降。
  • 该方法在检测准确率上比四种SOTA基线最高提升43.4%,在3项NLP任务和7种模型架构中均表现出一致的改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。