Skip to main content
QUICK REVIEW

[论文解读] RW-Resnet: A Novel Speech Anti-Spoofing Model Using Raw Waveform

Youxuan Ma, Zongze Ren|arXiv (Cornell University)|Aug 12, 2021
Speech Recognition and Synthesis参考文献 26被引用 5
一句话总结

该论文提出RW-ResNet,一种新颖的端到端语音反欺骗模型,直接以原始波形作为输入,利用一种新型的一维卷积残差块(Conv1D Resblock)提取可学习的时间-频率表征,称为ResWavegram。该模型在ASVspoof2019 LA语料库上实现了最先进性能,等错误率(EER)为2.98%,t-DCF为0.0817,通过有效保留音频信息并利用残差连接增强特征学习,显著优于现有方法。

ABSTRACT

In recent years, synthetic speech generated by advanced text-to-speech (TTS) and voice conversion (VC) systems has caused great harms to automatic speaker verification (ASV) systems, urging us to design a synthetic speech detection system to protect ASV systems. In this paper, we propose a new speech anti-spoofing model named ResWavegram-Resnet (RW-Resnet). The model contains two parts, Conv1D Resblocks and backbone Resnet34. The Conv1D Resblock is based on the Conv1D block with a residual connection. For the first part, we use the raw waveform as input and feed it to the stacked Conv1D Resblocks to get the ResWavegram. Compared with traditional methods, ResWavegram keeps all the information from the audio signal and has a stronger ability in extracting features. For the second part, the extracted features are fed to the backbone Resnet34 for the spoofed or bonafide decision. The ASVspoof2019 logical access (LA) corpus is used to evaluate our proposed RW-Resnet. Experimental results show that the RW-Resnet achieves better performance than other state-of-the-art anti-spoofing models, which illustrates its effectiveness in detecting synthetic speech attacks.

研究动机与目标

  • 为应对合成语音攻击对自动说话人验证(ASV)系统日益增长的威胁。
  • 克服传统手工设计特征(如LFCC和CQCC)因丢弃相位信息及其他关键音频特征而带来的局限性。
  • 开发一种端到端深度学习模型,直接处理原始波形,无需中间特征提取步骤。
  • 通过从原始音频中引入一种可学习的、基于神经网络的时间-频率表征,提升伪造与真实语音的检测性能。
  • 在ASVspoof2019逻辑访问基准测试中实现最先进性能。

提出的方法

  • 模型以原始波形作为输入,归一化至[-1, 1]范围,并通过堆叠的一维卷积残差块(Conv1D Resblocks)处理,生成一种可学习的时间-频率表征,称为ResWavegram。
  • 每个Conv1D残差块由两个空洞率分别为1和2的一维卷积层、ReLU激活函数、批量归一化层以及残差连接构成,以稳定训练过程并增强特征学习能力。
  • 通过堆叠多个Conv1D残差块提取ResWavegram特征,联合捕捉原始音频中的长时序与短时序时间模式。
  • 提取的ResWavegram被输入至ResNet34主干网络,完成对伪造或真实语音的最终分类。
  • 整个模型采用端到端方式训练,无需任何手工特征工程。
  • 该方法通过直接从波形域学习表征,避免了基于FFT特征固有的相位信息损失。

实验结果

研究问题

  • RQ1在原始波形上直接训练的深度学习模型,是否能超越依赖手工特征(如LFCC或CQCC)的传统反欺骗系统?
  • RQ2在一维卷积块中引入残差连接,是否能提升从原始音频中提取特征的能力,以用于欺骗检测?
  • RQ3从原始波形中衍生出的可学习时间-频率表征(ResWavegram),是否能实现优于标准谱图类特征的性能?
  • RQ4与使用工程化特征的系统相比,基于原始波形的端到端训练模型在ASVspoof2019 LA数据集上的EER和t-DCF表现如何?
  • RQ5所提出的RW-ResNet模型在ASVspoof2019挑战赛中,是否具有与顶级融合系统相当或更优的竞争力?

主要发现

  • RW-ResNet模型在ASVspoof2019 LA评估集上实现了2.98%的等错误率(EER),显著优于最佳基线模型(LFCC-GMM)的8.09% EER。
  • 该模型实现了0.0817的并联检测成本函数(t-DCF),相比最佳基线(0.212 t-DCF)提升了61%。
  • 与所有配置下基线的Wavegram特征相比,由Conv1D残差块提取的ResWavegram特征使EER降低了约12%。
  • 在(C1,C2,C3) = (64,128,128)的ResWavegram-M配置下,模型达到最佳性能,EER为2.98%,t-DCF为0.0817。
  • 所提出的RW-ResNet模型优于ASVspoof2019挑战赛中列出的所有单系统基线,包括S3-RawNet2(5.13% EER)和LFCC-Siamese CNN(3.79% EER)。
  • 尽管为单系统模型,其性能仍超越了ASVspoof2019挑战赛中前五名融合系统,仅低于排名第一的T05系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。