Skip to main content
QUICK REVIEW

[论文解读] Adversarial Attacks against Neural Networks in Audio Domain: Exploiting Principal Components

Ken Alparslan, Yigit Alparslan|arXiv (Cornell University)|Jul 14, 2020
Adversarial Robustness in Machine Learning参考文献 26被引用 9
一句话总结

本文在白盒和黑盒设置下,使用主成分分析(PCA)研究了针对语音识别神经网络的对抗性攻击。结果表明,PCA能够以100%的成功率有效生成对抗性音频样本,成功欺骗DeepSpeech模型;同时,PCA作为防御机制也失效,凸显了基于音频的深度学习系统中的漏洞。

ABSTRACT

Adversarial attacks are inputs that are similar to original inputs but altered on purpose. Speech-to-text neural networks that are widely used today are prone to misclassify adversarial attacks. In this study, first, we investigate the presence of targeted adversarial attacks by altering wave forms from Common Voice data set. We craft adversarial wave forms via Connectionist Temporal Classification Loss Function, and attack DeepSpeech, a speech-to-text neural network implemented by Mozilla. We achieve 100% adversarial success rate (zero successful classification by DeepSpeech) on all 25 adversarial wave forms that we crafted. Second, we investigate the use of PCA as a defense mechanism against adversarial attacks. We reduce dimensionality by applying PCA to these 25 attacks that we created and test them against DeepSpeech. We observe zero successful classification by DeepSpeech, which suggests PCA is not a good defense mechanism in audio domain. Finally, instead of using PCA as a defense mechanism, we use PCA this time to craft adversarial inputs under a black-box setting with minimal adversarial knowledge. With no knowledge regarding the model, parameters, or weights, we craft adversarial attacks by applying PCA to samples from Common Voice data set and achieve 100% adversarial success under black-box setting again when tested against DeepSpeech. We also experiment with different percentage of components necessary to result in a classification during attacking process. In all cases, adversary becomes successful.

研究动机与目标

  • 在白盒和黑盒设置下,研究利用PCA生成针对语音识别神经网络的定向对抗性攻击的可行性。
  • 评估PCA作为音频领域对抗性攻击防御机制的有效性。
  • 评估DeepSpeech在不同PCA分量保留程度下,对基于PCA重建生成的对抗性扰动的鲁棒性。
  • 探索在不同重建保真度水平下,对抗性攻击的可迁移性与可检测性。

提出的方法

  • 使用连接时序分类(CTC)损失函数生成对抗性音频样本,以针对DeepSpeech模型实现特定转录输出。
  • 应用PCA降低对抗性波形的维度,测试在不同分量保留率(10%至95%)下对DeepSpeech的有效性。
  • 通过在未访问模型权重或架构的情况下,对干净的Common Voice样本应用PCA后生成扰动,实现黑盒对抗性攻击。
  • 以DeepSpeech为目标模型,利用其基于RNN的LSTM架构和基于CTC的序列到序列学习进行语音转录。
  • 通过转录失败(零正确分类)衡量攻击成功率,并使用归一化编辑距离和相似性指数评估感知相似性。
  • 通过比较不同PCA分量阈值下的重建音频保真度和模型误分类率,评估对抗性鲁棒性。

实验结果

研究问题

  • RQ1在仅掌握极少模型知识的黑盒设置下,PCA能否有效用于生成对抗性音频样本?
  • RQ2将PCA作为防御机制是否能成功缓解语音识别系统中的对抗性攻击?
  • RQ3通过PCA分量保留实现的重建保真度与对抗性攻击成功率之间存在何种关系?
  • RQ4在保留95% PCA分量(例如)的情况下,对抗性样本与原始音频在感知上的相似度如何,能否逃避人类检测?
  • RQ5通过PCA生成的对抗性攻击在不同音频模型之间可迁移的程度如何,尤其是在DeepSpeech作为基准模型的背景下?

主要发现

  • 作者在白盒设置下,对所有25个生成的对抗性波形均实现了100%的对抗性攻击成功率,DeepSpeech未能转录原始输入,反而输出了目标句子。
  • 当使用PCA将对抗性样本重建并保留95%的频谱分量时,平均相似性指数为87.85%,归一化编辑距离为9,表明与原始音频具有高度感知相似性。
  • 即使仅保留10%的分量,对抗性攻击仍实现了100%的成功率,但平均相似性指数降至27.42%,归一化编辑距离增加至46,表明存在高度失真。
  • PCA作为防御机制完全无效,因为DeepSpeech未能转录任何经PCA重建的对抗性样本,证实PCA无法去除对抗性扰动。
  • 本研究证明,仅在干净数据上应用PCA即可在黑盒设置下成功生成对抗性攻击,且无需了解模型参数,即可实现100%成功率。
  • 在95%重建保真度的情况下,由于更高的感知相似性,攻击更具现实可行性,尽管转录完全失败,但对抗性样本仍难以被人类察觉。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。