[论文解读] Real-time, Universal, and Robust Adversarial Attacks Against Speaker Recognition Systems
本文提出了一种针对基于深度神经网络(DNN)的多类别说话人识别系统的首个实时、通用且鲁棒的定向对抗攻击。通过生成一种与音频内容无关的单一通用扰动,并利用房间脉冲响应(RIR)估计建模空中声学失真,该攻击在使系统误判方面成功率超过90%,同时相比非通用方法实现了100倍的部署速度提升。
As the popularity of voice user interface (VUI) exploded in recent years, speaker recognition system has emerged as an important medium of identifying a speaker in many security-required applications and services. In this paper, we propose the first real-time, universal, and robust adversarial attack against the state-of-the-art deep neural network (DNN) based speaker recognition system. Through adding an audio-agnostic universal perturbation on arbitrary enrolled speaker's voice input, the DNN-based speaker recognition system would identify the speaker as any target (i.e., adversary-desired) speaker label. In addition, we improve the robustness of our attack by modeling the sound distortions caused by the physical over-the-air propagation through estimating room impulse response (RIR). Experiment using a public dataset of 109 English speakers demonstrates the effectiveness and robustness of our proposed attack with a high attack success rate of over 90%. The attack launching time also achieves a 100X speedup over contemporary non-universal attacks.
研究动机与目标
- 解决针对多类别基于DNN的说话人识别系统缺乏实时、通用且鲁棒的对抗攻击的问题。
- 克服现有个体攻击方法的局限性,这些方法需要针对每段音频进行优化,且速度过慢,无法实现实时应用。
- 通过利用房间脉冲响应(RIR)估计建模空中声学失真,提升物理环境中的攻击鲁棒性。
- 仅使用单一可重用的扰动,实现将任意说话人定向误识别为预设目标说话人。
- 在包含109名说话人的公开数据集上,在真实声学条件下验证方法的高效率与高有效性。
提出的方法
- 设计一种与输入语音内容无关的通用扰动,可应用于任何注册说话人的语音输入。
- 通过重复播放固定长度的通用噪声,将扰动适配至可变长度的语音输入。
- 通过从模拟声学环境中估计房间脉冲响应(RIR),建模物理空间中的空中失真。
- 利用RIR估计的信道响应训练通用对抗扰动,以增强真实播放环境下的鲁棒性。
- 使用定向攻击目标函数优化扰动,使受害者说话人被错误分类为目标说话人。
- 采用信噪比(SNR)指标(单位为分贝,dB)量化扰动的不可感知性,确保音频失真近乎不可察觉。
实验结果
研究问题
- RQ1是否可以设计出一种单一的、通用的对抗扰动,使最先进的基于DNN的说话人识别系统将任意说话人误识别为目标说话人?
- RQ2当攻击受到物理空间中的空中声学失真(如房间反射和传播效应)影响时,其有效性如何?
- RQ3该攻击是否能够实现实时运行,显著缩短相比传统个体对抗攻击方法所需的时间?
- RQ4基于RIR的建模在多大程度上提升了对抗样本在真实世界部署场景中的鲁棒性?
- RQ5在真实声学条件下,扰动强度(噪声电平)与攻击成功率之间的权衡关系如何?
主要发现
- 所提出的通用攻击在-18.84 dB噪声电平下实现了平均99.95%的攻击成功率,证明了其高度有效性。
- 即使在极低噪声电平-33.96 dB下,攻击成功率仍保持在80%以上,表明扰动具有近乎不可察觉的特性。
- 通过基于RIR的鲁棒性训练,攻击在空中仿真中的平均成功率提升至90.19%,而未使用RIR建模时仅1.33%。
- 攻击启动时间缩短至0.015秒,相比传统非通用攻击方法每例约需15秒,实现了100倍的速度提升。
- 该方法在109名说话人上成功实现泛化,证实了扰动在多样化语音输入下的通用性与可扩展性。
- 结果表明,RIR估计显著增强了对抗样本在真实世界中的鲁棒性,使攻击在实际部署环境中具备可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。