[论文解读] Beyond $L_p$ clipping: Equalization-based Psychoacoustic Attacks against ASRs
本文提出了一种基于均衡的听觉心理攻击方法,利用人类听觉掩蔽效应,为传统和端到端自动语音识别(ASR)系统生成人耳几乎无法察觉的对抗性音频。通过使用听觉掩蔽阈值来约束扰动,该方法在DeepSpeech上实现了100%的成功率,在Wav2Letter上实现了76%的成功率,用户研究结果证实其可听失真显著低于最先进的$L_p$-基攻击方法。
Automatic Speech Recognition (ASR) systems convert speech into text and can be placed into two broad categories: traditional and fully end-to-end. Both types have been shown to be vulnerable to adversarial audio examples that sound benign to the human ear but force the ASR to produce malicious transcriptions. Of these attacks, only the "psychoacoustic" attacks can create examples with relatively imperceptible perturbations, as they leverage the knowledge of the human auditory system. Unfortunately, existing psychoacoustic attacks can only be applied against traditional models, and are obsolete against the newer, fully end-to-end ASRs. In this paper, we propose an equalization-based psychoacoustic attack that can exploit both traditional and fully end-to-end ASRs. We successfully demonstrate our attack against real-world ASRs that include DeepSpeech and Wav2Letter. Moreover, we employ a user study to verify that our method creates low audible distortion. Specifically, 80 of the 100 participants voted in favor of all our attack audio samples as less noisier than the existing state-of-the-art attack. Through this, we demonstrate both types of existing ASR pipelines can be exploited with minimum degradation to attack audio quality.
研究动机与目标
- 解决现有听觉心理攻击仅适用于基于信号处理特征提取的传统ASR系统的局限性。
- 开发一种对传统和完全端到端ASR架构均有效的统一攻击方法。
- 通过用听觉心理启发的扰动约束替代$L_p$裁剪,提升对抗性样本的音频质量。
- 通过用户研究对比CW攻击,验证对抗性音频的感知质量。
- 证明当应用适当的感知建模时,现代端到端ASR系统仍易受听觉心理攻击影响。
提出的方法
- 该攻击使用听觉心理模型计算频域掩蔽阈值,以此约束对抗性扰动的幅度。
- 扰动在时频域通过STFT生成,并应用均衡处理以确保能量低于掩蔽阈值。
- 该方法在时域和频域之间交替迭代,使用Griffin-Lim在扰动后重建音频信号。
- 采用迭代优化方法,在保持高ASR攻击成功率的同时最小化扰动能量。
- 该攻击使用相同框架应用于传统ASR(如DeepSpeech)和端到端模型(如Wav2Letter)。
- $L_p$裁剪方法在感知质量控制方面表现不足,因其未考虑人类听觉掩蔽效应。
实验结果
研究问题
- RQ1能否设计一种听觉心理攻击,使其对传统和完全端到端ASR系统均有效?
- RQ2与$L_p$裁剪相比,使用掩蔽阈值在感知音频质量方面表现如何?
- RQ3基于均衡的扰动在多大程度上对人类听觉系统保持不可察觉?
- RQ4该攻击在最小化可听失真的同时,是否仍能保持对现代端到端ASR系统的高成功率?
- RQ5能否开发一种统一的攻击框架,结合信号处理与听觉心理学,生成高质量的对抗性音频?
主要发现
- 所提出的基于均衡的攻击在传统DeepSpeech ASR模型上实现了100%的成功率。
- 该攻击在完全端到端的Wav2Letter模型上实现了76%的成功率,与最先进的基于优化的攻击方法相当。
- 在100名参与者的用户研究中,80%的参与者认为该方法生成的所有对抗性音频样本比CW攻击的样本更不嘈杂。
- 超过70%的参与者认为CW攻击的音频样本令人不适(轻微、令人困扰或非常令人困扰),而仅有2–32%的参与者认为本方法生成的样本可被察觉但不令人困扰。
- $\chi^2$检验证实音频质量存在显著差异(p < 0.01),验证了本方法产生的可听失真显著更少。
- 研究结果表明,$L_p$裁剪是一种在控制感知质量方面存在缺陷的方法,因其未考虑人类听觉掩蔽效应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。