Skip to main content
QUICK REVIEW

[论文解读] Trigger Hunting with a Topological Prior for Trojan Detection

Xiao Hu, Xiao Lin|arXiv (Cornell University)|Oct 15, 2021
Adversarial Robustness in Machine Learning参考文献 40被引用 7
一句话总结

本文提出了一种新颖的后门触发器搜索方法,用于后门检测,该方法利用拓扑先验以强制实现紧凑且局部化的触发器,并采用多样性损失以生成多个不同的触发器候选。通过提升触发器质量并实现与目标标签无关的检测,该方法在TrojAI基准测试中实现了最先进性能,即使在训练数据有限的情况下,AUC最高达到0.92。

ABSTRACT

Despite their success and popularity, deep neural networks (DNNs) are vulnerable when facing backdoor attacks. This impedes their wider adoption, especially in mission critical applications. This paper tackles the problem of Trojan detection, namely, identifying Trojaned models -- models trained with poisoned data. One popular approach is reverse engineering, i.e., recovering the triggers on a clean image by manipulating the model's prediction. One major challenge of reverse engineering approach is the enormous search space of triggers. To this end, we propose innovative priors such as diversity and topological simplicity to not only increase the chances of finding the appropriate triggers but also improve the quality of the found triggers. Moreover, by encouraging a diverse set of trigger candidates, our method can perform effectively in cases with unknown target labels. We demonstrate that these priors can significantly improve the quality of the recovered triggers, resulting in substantially improved Trojan detection accuracy as validated on both synthetic and publicly available TrojAI benchmarks.

研究动机与目标

  • 解决后门检测中高维、非结构化触发器搜索空间的挑战。
  • 在不依赖目标标签先验知识的情况下实现有效检测,尤其适用于现实场景中标签未知的情况。
  • 提升恢复触发器的质量与紧凑性,以减少误报并增强检测可靠性。
  • 开发一种鲁棒的、与标签无关的逆向工程框架,能够在有限训练数据下高效扩展。

提出的方法

  • 基于持久同调引入一种拓扑损失,以限制恢复触发器中连通分量的数量,确保空间上的紧凑性与局部化。
  • 采用多样性损失,在多次逆向工程运行中生成多个结构上不同的触发器候选。
  • 使用基于梯度的优化方法,结合拓扑损失与多样性损失,在干净输入上搜索潜在触发器。
  • 从恢复的触发器中提取几何、颜色与拓扑特征,同时结合网络激活模式用于下游检测。
  • 利用这些特征训练一个后门检测分类器,以区分良性模型与后门模型。
  • 支持监督与无监督检测设置,使方法具备灵活性并可广泛适用。

实验结果

研究问题

  • RQ1拓扑先验是否能改善基于逆向工程的后门检测中恢复触发器的紧凑性与局部化?
  • RQ2在目标标签未知的情况下,生成多样化的触发器候选如何提升检测性能?
  • RQ3在数据稀缺条件下,拓扑损失与多样性损失在多大程度上提升了检测准确率?
  • RQ4所提出的方法是否能在无需检测任务标签化训练数据的情况下实现最先进性能?

主要发现

  • 所提方法在TrojAI-Round4基准测试中实现了0.92的AUC,优于基线方法,展现出最先进性能。
  • 移除拓扑损失后,AUC下降至0.89,证实其在提升触发器紧凑性与搜索效率方面的重要作用。
  • 若移除多样性损失,AUC降至0.85,凸显其在无标签条件下提高真实触发器恢复概率的关键作用。
  • 仅使用25个训练样本时,该方法达到77%的准确率,显著优于基线,展现出对有限数据的强鲁棒性。
  • 拓扑损失可加速收敛,将找到有效触发器所需的迭代次数从约50轮减少至约30轮。
  • 该方法在监督与无监督检测设置下均保持优异性能,展现出广泛的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。