Skip to main content
QUICK REVIEW

[论文解读] ASSERT: Anti-Spoofing with Squeeze-Excitation and Residual neTworks

Cheng-I Lai, Nanxin Chen|arXiv (Cornell University)|Apr 1, 2019
Speech Recognition and Synthesis参考文献 33被引用 18
一句话总结

ASSERT 提出了一种基于深度神经网络(DNN)的反欺骗系统,结合挤压-激励(squeeze-excitation)与残差网络(residual networks),用于检测来自文本转语音(text-to-speech)、语音转换(voice conversion)和重放(replay)的欺骗攻击。通过优化特征工程、模型架构和集成融合策略,该系统在 ASVspoof 2019 PA 子挑战赛中实现了超过 93% 的 t-DCF 和 EER 相对提升,在 LA 子挑战赛中实现了 17% 的相对提升,分别获得第 3 名和第 14 名。

ABSTRACT

We present JHU's system submission to the ASVspoof 2019 Challenge: Anti-Spoofing with Squeeze-Excitation and Residual neTworks (ASSERT). Anti-spoofing has gathered more and more attention since the inauguration of the ASVspoof Challenges, and ASVspoof 2019 dedicates to address attacks from all three major types: text-to-speech, voice conversion, and replay. Built upon previous research work on Deep Neural Network (DNN), ASSERT is a pipeline for DNN-based approach to anti-spoofing. ASSERT has four components: feature engineering, DNN models, network optimization and system combination, where the DNN models are variants of squeeze-excitation and residual networks. We conducted an ablation study of the effectiveness of each component on the ASVspoof 2019 corpus, and experimental results showed that ASSERT obtained more than 93% and 17% relative improvements over the baseline systems in the two sub-challenges in ASVspooof 2019, ranking ASSERT one of the top performing systems. Code and pretrained models will be made publicly available.

研究动机与目标

  • 开发一种鲁棒的基于 DNN 的反欺骗流水线,能够检测包括重放、TTS 和语音转换在内的多种欺骗攻击。
  • 探究挤压-激励与残差网络变体在物理与逻辑访问场景下欺骗检测中的有效性。
  • 优化特征工程、网络架构与系统融合策略,以提升在 ASVspoof 2019 基准测试中的泛化能力与性能表现。
  • 在 PA 和 LA 子挑战赛中,相比 GMM 和 i-vector 等基线系统,在 t-DCF 和 EER 指标上实现性能超越。
  • 为未来反欺骗研究提供公开可访问的代码库与预训练模型。

提出的方法

  • 采用恒定 Q 倒谱系数(CQCC)与对数功率幅度谱(logspec)作为低层次声学特征,未使用 CMVN 或语音活动检测。
  • 通过将语音段扩展为 400 帧的倍数并以 200 帧重叠进行分段,构建统一的特征图以输入 DNN。
  • 基于 SENet34、SENet50、均值-方差残差网络(Mean-Std ResNet)、空洞残差网络(Dilated ResNet)以及注意过滤网络(Attentive-Filtering Network)设计 DNN 模型,并引入挤压-激励模块以实现特征重校准。
  • 使用二元交叉熵损失进行模型训练,并基于开发集准确率进行模型选择,而非基于 EER。
  • 采用早期融合与晚期融合策略,对五个单一系统(包括 SENet34、Mean-Std ResNet 和 Dilated ResNet)进行集成融合,以提升鲁棒性。
  • 使用 PyTorch 实现 DNN,使用 Kaldi 进行特征提取,未使用数据增强或外部数据。

实验结果

研究问题

  • RQ1在 ASVspoof 2019 挑战赛中,挤压-激励与残差网络变体在检测多种攻击类型(重放、TTS、VC)的欺骗攻击方面效果如何?
  • RQ2不同特征表示(CQCC 与 logspec)以及特征工程策略(带重叠的统一特征图 vs. 整个语音段)对反欺骗性能有何影响?
  • RQ3训练目标(二元 vs. 多任务)与模型选择标准(EER vs. 准确率)如何影响最终系统性能?
  • RQ4在 PA 和 LA 子挑战赛中,多个 DNN 模型的集成融合在多大程度上提升了对未见数据的泛化能力与鲁棒性?
  • RQ5所提出的基于 DNN 的系统在 t-DCF 和 EER 指标上,与传统基线系统(如 GMM 和 i-vector 系统)相比,其定量表现如何?

主要发现

  • 在 PA 子挑战赛评估集上,ASSERT 相较于 CQCC-GMM 基线,t-DCF 实现了 93% 的相对提升,EER 实现了 94% 的相对提升。
  • 在 LA 子挑战赛中,主系统相较 LFCC-GMM 基线,t-DCF 实现了 27% 的相对提升,EER 实现了 17% 的相对提升。
  • 表现最佳的单一系统(SENet34,使用 logspec 与 200 帧重叠的统一特征图)在 PA 的 t-DCF 和 EER 上分别优于所有基线系统,相对提升达 92% 和 94%。
  • 该系统在 PA 子挑战赛中排名第三,在 LA 子挑战赛中排名十四,展现出优异的泛化能力与鲁棒性。
  • 采用统一特征图与重叠策略的特征工程显著优于完整语音段或无重叠分段方法。
  • 消融实验确认,logspec 表现优于 CQCC,且基于准确率的模型选择优于基于 EER 的选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。