Skip to main content
QUICK REVIEW

[论文解读] Design and Evaluation of a Multi-Domain Trojan Detection Method on Deep Neural Networks

Yansong Gao, Yeonjae Kim|arXiv (Cornell University)|Nov 23, 2019
Adversarial Robustness in Machine Learning参考文献 32被引用 15
一句话总结

本文提出STRIP-ViTA,一种新颖的运行时后门检测方法,可在无需参考模型的情况下检测视觉、文本和语音领域深层神经网络中的后门触发器。该方法利用输入级扰动与熵分析检测异常,具有极低的误接受率(FAR),在视觉任务中实现0%的FAR与FRR,在文本和语音任务中FAR低于4%,展现出在不同模型架构与领域间的良好泛化能力。

ABSTRACT

This work corroborates a run-time Trojan detection method exploiting STRong Intentional Perturbation of inputs, is a multi-domain Trojan detection defence across Vision, Text and Audio domains---thus termed as STRIP-ViTA. Specifically, STRIP-ViTA is the first confirmed Trojan detection method that is demonstratively independent of both the task domain and model architectures. We have extensively evaluated the performance of STRIP-ViTA over: i) CIFAR10 and GTSRB datasets using 2D CNNs, and a public third party Trojaned model for vision tasks; ii) IMDB and consumer complaint datasets using both LSTM and 1D CNNs for text tasks; and speech command dataset using both 1D CNNs and 2D CNNs for audio tasks. Experimental results based on 28 tested Trojaned models demonstrate that STRIP-ViTA performs well across all nine architectures and five datasets. In general, STRIP-ViTA can effectively detect Trojan inputs with small false acceptance rate (FAR) with an acceptable preset false rejection rate (FRR). In particular, for vision tasks, we can always achieve a 0% FRR and FAR. By setting FRR to be 3%, average FAR of 1.1% and 3.55% are achieved for text and audio tasks, respectively. Moreover, we have evaluated and shown the effectiveness of STRIP-ViTA against a number of advanced backdoor attacks whilst other state-of-the-art methods lose effectiveness in front of one or all of these advanced backdoor attacks.

研究动机与目标

  • 解决当前缺乏可在多个领域(视觉、文本、语音)及模型架构间通用的后门检测方法的问题。
  • 开发一种无需真实参考模型、训练数据或特定机器学习专业知识的检测方法。
  • 评估方法在多种DNN架构与数据集上对高级、输入无关后门攻击的鲁棒性。
  • 实现在真实部署场景中高检测准确率,同时保持极低的误接受率与误拒绝率。

提出的方法

  • STRIP-ViTA使用领域特定的扰动模式(如视觉领域的像素块、文本领域的词替换、语音领域的频谱掩码)对输入施加结构化、有意的扰动。
  • 通过计算多个扰动输入下模型预测结果的熵,检测由后门引发的异常输出方差。
  • 检测边界完全基于已部署模型的行为确定,无需参考模型或干净模型。
  • 扰动模式在各领域中设计为不可察觉或自然,确保隐蔽性与真实世界适用性。
  • 每输入可配置扰动模式数量(N),N值经优化以平衡检测灵敏度与运行时开销。
  • 检测在推理阶段执行,支持实时部署,无需重新训练或访问训练数据。

实验结果

研究问题

  • RQ1是否可开发一种后门检测方法,在不依赖模型特异性或任务特异性假设的前提下,有效适用于视觉、文本与语音领域?
  • RQ2是否可实现高精度检测,同时在多种DNN架构中保持极低的误报与漏报?
  • RQ3是否可能在无需真实参考模型或额外训练的情况下检测后门?
  • RQ4STRIP-ViTA在对抗先进、输入无关后门攻击(可规避现有防御机制)时表现如何?
  • RQ5STRIP-ViTA在实时应用(如交通识别与语音处理)中的运行时开销如何?

主要发现

  • 在所有视觉任务中(包括CIFAR10与GTSRB),STRIP-ViTA实现0%误接受率(FAR)与0%误拒绝率(FRR),使用2D CNN与第三方后门模型验证。
  • 在IMDB与消费者投诉数据集的文本任务中,STRIP-ViTA平均FAR为1.1%,预设FRR为3%。
  • 在语音命令数据集的音频任务中,STRIP-ViTA平均FAR为3.55%,FRR为3%,展现出强大的跨领域泛化能力。
  • 该方法对多种高级后门攻击仍具有效性,包括可规避最先进防御方法(如Neural Cleanse与ABS)的攻击。
  • 运行时开销极低:视觉任务(ResNet20)为1.32倍,文本任务(IMDB+LSTM)为4.24倍,音频任务(SC+1D CNN)为1.62倍,且未经优化,表明具备实时可行性。
  • 该方法对模型复杂度与数据集差异具有鲁棒性,在九种不同架构与五个数据集上检测性能稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。