Skip to main content
QUICK REVIEW

[论文解读] Identifying Audio Adversarial Examples via Anomalous Pattern Detection

Victor Akinwande, Celia Cintas|arXiv (Cornell University)|Feb 13, 2020
Adversarial Robustness in Machine Learning参考文献 31被引用 11
一句话总结

本文提出一种基于神经网络激活空间子集扫描的无监督异常模式检测方法,用于识别音频对抗性样本。该方法在不降低良性样本性能的前提下,实现了高达 AUC 0.982 的检测性能,能够有效检测当前最先进的攻击方法,通过模型各层中统计显著的激活异常实现鲁棒检测。

ABSTRACT

Audio processing models based on deep neural networks are susceptible to adversarial attacks even when the adversarial audio waveform is 99.9% similar to a benign sample. Given the wide application of DNN-based audio recognition systems, detecting the presence of adversarial examples is of high practical relevance. By applying anomalous pattern detection techniques in the activation space of these models, we show that 2 of the recent and current state-of-the-art adversarial attacks on audio processing systems systematically lead to higher-than-expected activation at some subset of nodes and we can detect these with up to an AUC of 0.98 with no degradation in performance on benign samples.

研究动机与目标

  • 在不了解攻击类型或缺乏标注数据的情况下检测对抗性音频输入。
  • 开发一种在深度神经网络激活空间中运行的无监督检测机制。
  • 在检测对抗性扰动的同时,保持对良性音频样本的高准确率。
  • 识别不同音频处理模型和数据集上对抗性样本的通用特性。

提出的方法

  • 采用非参数扫描统计方法,检测深度神经网络层中神经元激活的异常子集。
  • 通过在层中所有可能的节点子集中进行优化,定义一个实值异常评分。
  • 利用良性样本的激活背景分布,为每个子集计算 p 值。
  • 应用子集扫描(SS)以识别对抗性输入中高激活节点的统计显著聚类。
  • 通过聚焦于激活异常最具区分性的层(如 DeepSpeech 中的 'relu_2' 层)来优化检测过程。
  • 将该方法作为即插即用的检测器集成到现有模型中,无需微调或数据增强。

实验结果

研究问题

  • RQ1深度神经网络层中的异常激活模式能否可靠地区分对抗性音频输入与良性输入?
  • RQ2所提出的方法是否能以高性能和极低误报率检测多种当前最先进的音频对抗攻击?
  • RQ3子集扫描是否能在不了解攻击类型或缺乏标注训练数据的情况下检测对抗性样本?
  • RQ4在音频模型中,检测对抗性扰动时最具区分性的层和激活子集是什么?
  • RQ5与依赖预处理或模型微调的现有防御方法相比,该检测方法的性能如何?

主要发现

  • 在使用 DeepSpeech 模型的 LibriSpeech 数据集上,该方法在 'relu_2' 层实现了 AUC 0.982 的性能,优于当前最先进的检测方法。
  • 在 Common Voice 数据集上,使用相同模型和层,该方法实现了 AUC 0.973 的性能,表明其在不同数据集间具有强大的泛化能力。
  • 该方法在良性样本上保持了完整的准确率,避免了预处理类防御中常见的性能下降问题。
  • 检测性能在两种不同的最先进的攻击(Carlini & Wagner, 2018 和 Qin et al., 2019)下均保持一致。
  • 该方法识别出对抗性样本会在特定神经元子集中引发统计显著的激活异常,这些异常可通过子集扫描检测到。
  • 检测性能最高的层为 DeepSpeech 的 'relu_2' 层,表明该层包含对抗性输入最具区分性的激活模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。