Skip to main content
QUICK REVIEW

[论文解读] Adversarial Attacks on Spoofing Countermeasures of automatic speaker verification

Songxiang Liu, Haibin Wu|arXiv (Cornell University)|Oct 19, 2019
Speech Recognition and Synthesis参考文献 31被引用 16
一句话总结

本文研究了在自动说话人验证(ASV)中,高性能欺骗检测对策对使用FGSM和PGD方法的对抗性攻击的脆弱性。结果表明,白盒和黑盒攻击均能有效降低模型性能,其中PGD攻击效果更优,表明即使是最先进的对策也易受对抗样本影响。

ABSTRACT

High-performance spoofing countermeasure systems for automatic speaker verification (ASV) have been proposed in the ASVspoof 2019 challenge. However, the robustness of such systems under adversarial attacks has not been studied yet. In this paper, we investigate the vulnerability of spoofing countermeasures for ASV under both white-box and black-box adversarial attacks with the fast gradient sign method (FGSM) and the projected gradient descent (PGD) method. We implement high-performing countermeasure models in the ASVspoof 2019 challenge and conduct adversarial attacks on them. We compare performance of black-box attacks across spoofing countermeasure models with different network architectures and different amount of model parameters. The experimental results show that all implemented countermeasure models are vulnerable to FGSM and PGD attacks under the scenario of white-box attack. The more dangerous black-box attacks also prove to be effective by the experimental results.

研究动机与目标

  • 评估最先进的ASV欺骗检测对策在对抗攻击下的鲁棒性。
  • 评估白盒和黑盒对抗攻击场景在欺骗检测模型上的有效性。
  • 比较不同架构和参数量模型在攻击性能上的差异。
  • 探究从一个模型生成的对抗样本是否能有效攻击另一个模型,尤其是在黑盒设置下。
  • 提供开源代码以支持ASV系统对抗鲁棒性研究的可复现性与未来研究。

提出的方法

  • 从ASVspoof 2019挑战赛中选取三种高性能欺骗检测模型:LCNN-big、LCNN-small和SENet12。
  • 采用白盒对抗攻击方法,使用FGSM和PGD在不同扰动幅度(ε)下生成对抗性音频样本。
  • 通过在目标模型的输入-输出行为上训练替代模型,实施黑盒攻击,进而生成对抗样本。
  • 以EER(等错误率)为主要评估指标,操作点设定为原始评估集的EER值。
  • 生成频谱图并开展主观XAB听音测试,以验证对抗扰动在感知上与原始音频的不可区分性。
  • 比较不同模型架构和参数规模下的攻击效果,分析对抗样本的可迁移性。

实验结果

研究问题

  • RQ1在白盒条件下,ASV中的高性能欺骗检测对策是否易受对抗攻击?
  • RQ2当仅能访问输入-输出接口时,黑盒对抗攻击是否能成功欺骗欺骗检测模型?
  • RQ3模型架构和参数量如何影响黑盒攻击中对抗样本的可迁移性与有效性?
  • RQ4从大模型(如LCNN-big)生成的对抗样本是否比从小模型(如LCNN-small、SENet12)生成的样本更有效地攻击其他模型?
  • RQ5对抗扰动在多大程度上与原始音频在感知上不可区分,从而保持攻击的隐蔽性?

主要发现

  • 所有三种实现的欺骗检测模型(LCNN-big、LCNN-small、SENet12)在白盒FGSM和PGD设置下均被成功攻击,当ε = 5时,EER接近或超过50%。
  • PGD攻击始终优于FGSM攻击,在ε = 5时,LCNN-big的EER超过85%,表明检测能力完全崩溃。
  • 黑盒攻击极为有效,从LCNN-big生成的对抗样本可成功攻击LCNN-small和SENet12模型,达到高EER值。
  • 从大模型(LCNN-big)生成的对抗样本比从小模型(LCNN-small、SENet12)生成的样本更具可迁移性与有效性,尤其在攻击大模型目标时表现更优。
  • 当源模型与目标模型架构相似时,攻击成功率更高,例如使用LCNN-big生成的样本攻击LCNN-small时,EER高于使用RESNet12生成的样本。
  • 主观XAB听音测试确认,对抗扰动在感知上与原始音频不可区分,验证了攻击的隐蔽性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。