Skip to main content
QUICK REVIEW

[论文解读] Attacking Speaker Recognition With Deep Generative Models

Wilson Cai, Anish P. Doshi|arXiv (Cornell University)|Jan 8, 2018
Digital Media Forensic Detection参考文献 14被引用 20
一句话总结

本文提出了一种基于生成对抗网络(GAN)的新方法,用于生成能够成功欺骗基于深度学习的说话人识别系统的对抗性语音样本。通过修改Wasserstein GAN损失函数,引入真实非目标说话人数据,该方法实现了定向与非定向攻击,在定向攻击成功率上提升了75%(错误率从0.38降至0.12)。

ABSTRACT

In this paper we investigate the ability of generative adversarial networks (GANs) to synthesize spoofing attacks on modern speaker recognition systems. We first show that samples generated with SampleRNN and WaveNet are unable to fool a CNN-based speaker recognition system. We propose a modification of the Wasserstein GAN objective function to make use of data that is real but not from the class being learned. Our semi-supervised learning method is able to perform both targeted and untargeted attacks, raising questions related to security in speaker authentication systems.

研究动机与目标

  • 探究深度生成模型(尤其是GAN)是否可用于生成对现代说话人识别系统有效的对抗性攻击。
  • 评估现有自回归模型(如SampleRNN和WaveNet)在说话人识别系统中的鲁棒性,因其常被用于语音合成。
  • 开发一种半监督的、基于GAN的攻击框架,通过引入非目标说话人数据来提升定向攻击性能。
  • 通过引入使用混合真实数据分布的改进损失函数,解决定向攻击中模式崩溃和多样性不足的问题。
  • 评估使用所有可用说话人数据(无论类别标签)训练的GAN实现非定向攻击的可行性。

提出的方法

  • 提出一种改进的Wasserstein GAN目标函数,将所有说话人的真实语音样本(而不仅目标类别)纳入损失函数,以提升生成器的多样性与攻击性能。
  • 使用混合损失函数训练WGAN-GP模型,通过来自多个说话人的真实数据引导生成器生成逼真且可用于攻击的梅尔频谱图。
  • 使用预训练的基于CNN的说话人验证器(修改版AlexNet)从梅尔频谱图中提取深层特征(1024维),用于评估及在攻击测试期间进行K近邻分类。
  • 在深度特征空间中应用K=5的K近邻(KNN)分类器,将生成的梅尔频谱图映射至预测的说话人身份。
  • 通过在梯度惩罚下优化WGAN-GP损失,使生成器能够生成与真实样本难以区分的梅尔频谱图。
  • 在训练过程中向目标说话人数据添加高斯噪声,以防止过拟合并提升攻击生成器的泛化能力。

实验结果

研究问题

  • RQ1自回归生成模型(如SampleRNN和WaveNet)能否成功生成欺骗现代基于CNN的说话人识别系统的欺骗性攻击?
  • RQ2标准GAN在通过生成被说话人验证器识别为真实的梅尔频谱图方面,能在多大程度上实现非定向攻击?
  • RQ3包含非目标说话人数据的改进WGAN损失函数是否能提升对说话人识别系统的定向对抗攻击成功率?
  • RQ4在GAN训练过程中引入来自多个说话人的多样化真实语音数据,如何影响生成的对抗性样本的质量与真实感?
  • RQ5所提出的混合损失函数对定向说话人欺骗攻击中错误率与攻击成功率的定量影响是什么?

主要发现

  • 由SampleRNN和WaveNet生成的样本无法欺骗基于CNN的说话人识别系统,无任何预测结果匹配目标说话人。
  • 所提出的采用混合损失函数的改进WGAN-GP在定向攻击中实现了0.12的错误率,相较于基线WGAN-GP(错误率为0.38)提升了75%。
  • 使用GAN框架进行的非定向攻击成功生成了被说话人验证器识别为真实的梅尔频谱图,且无任何样本被归类为“其他”类别。
  • 生成器在5000次迭代后,能够学习并重现数据集中所有说话人的梅尔频谱图特征,未出现模式崩溃,经视觉检查确认。
  • 经过5000次生成器迭代后,改进的WGAN-GP框架生成的梅尔频谱图在视觉上与真实样本无法区分,训练在单张4GB GPU上耗时约10小时。
  • KNN分类器成功将生成样本映射至其在深度特征空间中的最近邻说话人,从而在定向与非定向设置下均实现了攻击成功率的准确评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。