[论文解读] Universal Adversarial Perturbations Generative Network for Speaker Recognition
本文提出一种生成对抗网络,可将低维噪声映射为说话人识别系统的通用对抗扰动(UAPs),从而实现对各类输入的高效、高成功率攻击。该方法在TIMIT数据集上实现97.0%的说话人错误率(SER),信噪比(SNR)达49.87 dB,PESQ值为3.00,表明其能有效且难以察觉地欺骗最先进的模型。
Attacking deep learning based biometric systems has drawn more and more attention with the wide deployment of fingerprint/face/speaker recognition systems, given the fact that the neural networks are vulnerable to the adversarial examples, which have been intentionally perturbed to remain almost imperceptible for human. In this paper, we demonstrated the existence of the universal adversarial perturbations~(UAPs) for the speaker recognition systems. We proposed a generative network to learn the mapping from the low-dimensional normal distribution to the UAPs subspace, then synthesize the UAPs to perturbe any input signals to spoof the well-trained speaker recognition model with high probability. Experimental results on TIMIT and LibriSpeech datasets demonstrate the effectiveness of our model.
研究动机与目标
- 探究基于深度学习的说话人识别系统中是否存在通用对抗扰动(UAPs)。
- 开发一种生成模型,能够从低维噪声高效合成UAPs,实现快速且可扩展的攻击。
- 在大规模数据集上,评估生成的UAPs在非目标攻击与目标攻击设置下的有效性。
- 证明模型学习到的是有意义的、可迁移的通用模式,而非随机噪声。
提出的方法
- 训练一个生成网络,将低维标准正态分布映射到通用对抗扰动(UAPs)的子空间。
- 生成器学习生成对各种输入语音都有效的UAPs,且不依赖于特定输入内容。
- 模型采用潜在空间采样策略,将来自𝒩(0,1)的噪声向量通过深度神经网络映射为UAPs。
- 通过将生成的UAP添加到任意输入音频信号中来实施攻击,无论说话人或内容如何。
- 该方法在单次训练后即可实现高效的UAP生成,优于迭代优化方法。
- 使用噪声插值验证模型将潜在空间连续映射到UAP子空间。

实验结果
研究问题
- RQ1能否有效生成并应用通用对抗扰动(UAPs)于说话人识别模型?
- RQ2生成模型能否学习将低维噪声映射为在多样化音频输入中均具有泛化能力的UAPs?
- RQ3与随机扰动相比,生成的UAPs在攻击成功率和音频质量方面表现如何?
- RQ4该模型是否在UAP空间中学习到可迁移的、有意义的模式,而非随机噪声?
- RQ5UAP长度和潜在空间插值如何影响攻击性能和感知质量?
主要发现
- 所提出的生成模型在TIMIT数据集的非目标攻击中,实现了97.0%的说话人错误率(SER),信噪比(SNR)为49.87 dB,PESQ值为3.00。
- 在目标攻击中,该模型在TIMIT上实现了97.2%的平均目标扰动率(PTR),在LibriSpeech上为64.1%,且感知质量高(PESQ分别为约2.48和2.11)。
- 与随机扰动相比,该模型生成的UAPs在SER和感知质量(PESQ)方面均表现更优,尤其在高PESQ水平下优势明显。
- 消融实验证实,模型学习到了有用的、可迁移的通用模式,表现为在插值潜在向量上性能保持一致。
- 在高SNR水平下,较短的UAPs(200ms)优于较长的UAPs(600ms),表明优化对UAP长度敏感。
- 潜在空间中的噪声插值生成了稳定一致的UAPs,SER、SNR和PESQ均保持稳定,证实了模型对UAP子空间的连续映射。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。