Skip to main content
QUICK REVIEW

[论文解读] One-pixel Signature: Characterizing CNN Models for Backdoor Detection

Shanjiaoyang Huang, Wei‐Qi Peng|arXiv (Cornell University)|Aug 18, 2020
Adversarial Robustness in Machine Learning参考文献 27被引用 10
一句话总结

本文提出了一种名为单像素签名的新型、与模型架构无关的表示方法,用于表征卷积神经网络(CNN)模型,从而在无需访问模型参数的情况下实现高效的后门检测。通过逐像素生成对抗性扰动以最大化类别预测的变化,该方法在检测准确率上相比先前方法实现了30%的绝对提升,展现出在不同架构和数据集上的强大泛化能力。

ABSTRACT

We tackle the convolution neural networks (CNNs) backdoor detection problem by proposing a new representation called one-pixel signature. Our task is to detect/classify if a CNN model has been maliciously inserted with an unknown Trojan trigger or not. Here, each CNN model is associated with a signature that is created by generating, pixel-by-pixel, an adversarial value that is the result of the largest change to the class prediction. The one-pixel signature is agnostic to the design choice of CNN architectures, and how they were trained. It can be computed efficiently for a black-box CNN model without accessing the network parameters. Our proposed one-pixel signature demonstrates a substantial improvement (by around 30% in the absolute detection accuracy) over the existing competing methods for backdoored CNN detection/classification. One-pixel signature is a general representation that can be used to characterize CNN models beyond backdoor detection.

研究动机与目标

  • 为解决在无法访问模型参数或架构细节的情况下检测CNN模型中后门这一关键安全挑战。
  • 开发一种通用表示方法,揭示干净与后门CNN模型的内在特性。
  • 在未知或复杂后门触发器下,超越现有方法(如Neural Cleanse和ABS)的检测准确率。
  • 在极少训练数据条件下实现有效检测,并在多种CNN架构和数据集间保持高度泛化能力。

提出的方法

  • 单像素签名通过优化单像素扰动以最大化模型预测类别概率的变化来计算。
  • 对于每张输入图像,该方法寻找能引起模型输出分布最大变化的像素位置与取值,从而为每个模型生成一个签名。
  • 该签名与CNN架构、训练过程及超参数无关,支持黑盒应用。
  • 使用这些签名作为输入训练后门检测器,通过有监督分类区分干净模型与后门模型。
  • 该方法将单像素签名的每个通道视为独立的训练样本,显著提升数据效率。
  • 默认图像$I_o$设为零(即黑色图像),以提升计算简洁性与鲁棒性,实证验证表明其检测性能优异。

实验结果

研究问题

  • RQ1能否设计一种无需参数、与架构无关的表示方法,以揭示CNN中后门的特征?
  • RQ2单像素签名在不同CNN架构和数据集上的后门检测效果如何?
  • RQ3该方法在未见架构与后门模式下的泛化能力有多强?
  • RQ4在低数据场景下,以及面对如全对一或全对全后门等复杂攻击模式时,该方法表现如何?

主要发现

  • 单像素签名在后门检测准确率上相比Neural Cleanse和ABS等现有方法实现了30%的绝对提升。
  • 在MNIST数据集上,检测器在不同架构间实现泛化,平均检测率达到80%,即使测试模型架构未知亦成立。
  • 仅使用25对干净与后门模型对,该方法在MNIST上实现约95%的检测准确率;在GTSRB上使用175对时达到87.31%的准确率。
  • 将单像素签名的各个通道作为独立训练样本,显著提升数据效率,在仅100对训练样本下于GTSRB上实现97%的检测准确率。
  • 该方法在全对一与全对全后门攻击下保持超过95%的检测成功率,优于Neural Cleanse和ABS(后者仅约50%成功率)。
  • 将默认图像$I_o$设为零(即黑色图像)可获得最佳实证性能,且无需访问训练数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。