Skip to main content
QUICK REVIEW

[论文解读] UR Channel-Robust Synthetic Speech Detection System for ASVspoof 2021

Xinhui Chen, You Zhang|arXiv (Cornell University)|Jul 26, 2021
Speech Recognition and Synthesis参考文献 32被引用 4
一句话总结

本论文介绍了 UR-AIR 系统在 ASVspoof 2021 挑战赛中的应用,提出了一种基于编解码器和冲激响应增强的通道鲁棒性合成语音检测框架,以提升泛化能力。该系统采用 ECAPA-TDNN 配合一类学习与模型融合策略,在 LA 赛道上实现 EER 5.46% 和 min-tDCF 0.3094,在 DF 赛道上实现 EER 20.33%。

ABSTRACT

In this paper, we present UR-AIR system submission to the logical access (LA) and the speech deepfake (DF) tracks of the ASVspoof 2021 Challenge. The LA and DF tasks focus on synthetic speech detection (SSD), i.e. detecting text-to-speech and voice conversion as spoofing attacks. Different from previous ASVspoof challenges, the LA task this year presents codec and transmission channel variability, while the new task DF presents general audio compression. Built upon our previous research work on improving the robustness of the SSD systems to channel effects, we propose a channel-robust synthetic speech detection system for the challenge. To mitigate the channel variability issue, we use an acoustic simulator to apply transmission codec, compression codec, and convolutional impulse responses to augmenting the original datasets. For the neural network backbone, we propose to use Emphasized Channel Attention, Propagation and Aggregation Time Delay Neural Networks (ECAPA-TDNN) as our primary model. We also incorporate one-class learning with channel-robust training strategies to further learn a channel-invariant speech representation. Our submission achieved EER 20.33% in the DF task; EER 5.46% and min-tDCF 0.3094 in the LA task.

研究动机与目标

  • 解决在未见欺骗方式和通道条件下合成语音检测(SSD)系统中的泛化差距问题。
  • 提升反欺骗系统对传输和音频压缩变化的鲁棒性。
  • 通过数据增强和训练策略构建通道无关的语音表征。
  • 在 ASVspoof 2021 挑战赛的 LA 和 DF 赛道上实现最先进性能。
  • 探究 ECAPA-TDNN 在反欺骗任务中的有效性以及模型融合带来的性能增益。

提出的方法

  • 使用声学模拟器对训练数据进行增强,引入固定电话、移动通信和 VoIP 的传输编解码器,以及 MP3、AAC 等压缩编解码器,同时加入设备冲激响应(IRs)。
  • 采用多阶段数据增强流程:首先应用编解码器退化处理,随后可选地与设备 IR 进行卷积,以模拟真实世界中的信道效应。
  • 以 ECAPA-TDNN 作为主要神经网络主干网络,采用不同通道维度(C=512, 1024)和架构改进的变体。
  • 结合一类学习与通道鲁棒性训练,学习在多种通道条件下保持不变的表征。
  • 融合多个 ECAPA-TDNN 变体以提升检测性能,利用集成学习实现更好的泛化能力。
  • 在最终提交前,基于增强后的开发集,使用 min-tDCF 和 EER 指标对系统进行优化。

实验结果

研究问题

  • RQ1基于编解码器和冲激响应的数据增强在提升未见通道条件下 SSD 泛化能力方面有多有效?
  • RQ2ECAPA-TDNN 能否有效适配反欺骗任务?其架构在模型规模增大时表现如何?
  • RQ3一类学习与通道鲁棒性训练相结合,在增强模型对通道变化的不变性方面有多显著?
  • RQ4模型融合在 DF 和 LA 赛道上对未见欺骗方式和压缩条件下的性能提升程度如何?
  • RQ5过参数化对 ECAPA-TDNN 在反欺骗任务中的性能有何影响,特别是是否存在过拟合现象?

主要发现

  • UR-AIR 系统在 LA 赛道上实现 EER 5.46% 和 min-tDCF 0.3094,优于所有基线系统。
  • 在 DF 赛道上,系统实现 EER 20.33%,展现出在通用音频压缩条件下的强大性能。
  • 模型融合显著提升了检测性能,融合后的系统在增强后的开发集上优于所有单个模型。
  • 较小的 ECAPA-TDNN 变体(C=512)优于较大的变体(C=1024),表明尽管参数量更高,大模型仍存在过拟合现象。
  • 一类学习与通道鲁棒性训练策略的结合,使模型在不同编解码器和通道条件下的表现更加一致。
  • 在数据增强中引入设备冲激响应,有效降低了 ASVspoof 2019 训练集带来的数据集偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。