Skip to main content
QUICK REVIEW

[论文解读] Perceptual Based Adversarial Audio Attacks

Joseph Szurley, J. Zico Kolter|arXiv (Cornell University)|Jun 14, 2019
Adversarial Robustness in Machine LearningComputer Science参考文献 25被引用 18
一句话总结

本文提出了一种基于感知的、物理上可实现的对抗性音频攻击方法,利用听觉掩蔽效应在时域生成几乎不可察觉的扰动。通过在优化过程中同时考虑对抗性成功率与感知质量(使用PESQ衡量)以及通过合成房间冲击响应实现鲁棒性,该方法在语言模型解码器下于空中传输测试中实现了0%的WER和CER,即使在信噪比(SNR)下降的条件下也保持有效。

ABSTRACT

Recent work has shown the possibility of adversarial attacks on automatic speechrecognition (ASR) systems. However, in the vast majority of work in this area, theattacks have been executed only in the digital space, or have involved short phrasesand static room settings. In this paper, we demonstrate a physically realizableaudio adversarial attack. We base our approach specifically on a psychoacoustic-property-based loss function, and automated generation of room impulse responses, to create adversarial attacks that are robust when played over a speaker in multiple environments. We show that such attacks are possible even while being virtually imperceptible to listeners.

研究动机与目标

  • 开发一种在物理上可实现的对抗性音频攻击方法,使其对人类听觉系统几乎不可察觉,同时成功欺骗自动语音识别(ASR)系统。
  • 将听觉掩蔽阈值整合到对抗性优化过程中,以减少感知失真,且不依赖频域反向传播。
  • 通过在攻击生成过程中引入合成房间冲击响应,确保对抗性样本在空中传输条件下的鲁棒性。
  • 通过使用PESQ分数作为感知质量的客观度量,消除对主观听音测试的依赖。
  • 在真实物理环境中评估该攻击,包括多说话人和可变SNR场景,以证明其在现实世界中的可行性。

提出的方法

  • 该方法通过利用DFT对称性从原始音频的频域表示中提取听觉掩蔽阈值,在时域中形式化对抗性攻击,避免了不稳定的频域反向传播。
  • 采用$l_2$-范数约束的优化方法,结合投影梯度下降,生成最大化ASR误分类同时最小化感知失真的对抗性扰动。
  • 通过感知评价语音质量(PESQ)分数优化感知质量,该分数可作为人类听音测试的代理指标。
  • 在攻击生成过程中生成并应用合成房间冲击响应,以模拟真实世界中的空中传播效应,从而增强鲁棒性。
  • 使用贪婪解码器和基于语言模型的ASR解码器对攻击进行评估,以分析在不同信噪比(SNR)条件下的错误率。
  • 在自由场和多说话人环境中对方法进行验证,包括4英寸说话人间距与6英寸麦克风距离的设置,以测试其物理鲁棒性。

实验结果

研究问题

  • RQ1能否利用听觉原理使对抗性音频攻击在物理上可实现且对人类听觉系统几乎不可察觉?
  • RQ2将PESQ等感知质量度量整合进来,如何提升对抗性音频攻击的有效性与真实性?
  • RQ3合成房间冲击响应在多大程度上增强了空中ASR攻击中对抗性样本的鲁棒性?
  • RQ4在不同SNR条件下,不同的ASR解码策略(贪婪解码 vs. 语言模型解码)如何影响对抗性攻击的成功率?
  • RQ5经过感知优化的对抗性样本在经历物理失真(如削波和路径损耗)后,是否仍能保持高攻击成功率?

主要发现

  • 在平均SNR为66.7 dBA的双说话人空中传输设置中,使用语言模型解码器的4次试验中有3次实现了0%的词错误率(WER)和0%的字符错误率(CER)。
  • 在SNR为60–70 dBA的条件下,语言模型解码器的WER为4.0,CER为2.4;而贪婪解码器的WER为3.0,CER为2.25,表明语言建模显著提升了鲁棒性。
  • 该攻击保持了较高的感知质量,PESQ分数显示尽管存在对抗性扰动,语音质量仍得到改善,证实了听觉损失函数的有效性。
  • 在高SNR条件下因信号幅度超过麦克风限制而发生削波,显著增加了WER和CER,凸显了在实际部署中控制幅度的重要性。
  • 该方法成功生成了在多个物理环境中均不可察觉且鲁棒的对抗性样本,包括自由场室和多说话人场景。
  • 该攻击在物理信道效应下表现出强大的泛化能力,即使随着说话人与麦克风距离增加导致SNR下降,性能仍保持稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。