Skip to main content
QUICK REVIEW

[论文解读] Does Audio Deepfake Detection Generalize?

Nicolas M. Müller, Pavel Czempin|arXiv (Cornell University)|Mar 30, 2022
Music and Audio Processing被引用 7
一句话总结

本文使用标准化协议系统性地评估了12种音频深度伪造检测模型,并引入了一个包含37.9小时真实世界音频伪造样本的新型野外数据集。研究发现,基于ASVspoof基准训练的模型在真实世界数据上的泛化能力较差,性能最高下降达1,000%。研究识别出cqtspec/logspec特征以及完整长度音频输入是提升检测准确率和鲁棒性的关键因素。

ABSTRACT

Current text-to-speech algorithms produce realistic fakes of human voices, making deepfake detection a much-needed area of research. While researchers have presented various techniques for detecting audio spoofs, it is often unclear exactly why these architectures are successful: Preprocessing steps, hyperparameter settings, and the degree of fine-tuning are not consistent across related work. Which factors contribute to success, and which are accidental? In this work, we address this problem: We systematize audio spoofing detection by re-implementing and uniformly evaluating architectures from related work. We identify overarching features for successful audio deepfake detection, such as using cqtspec or logspec features instead of melspec features, which improves performance by 37% EER on average, all other factors constant. Additionally, we evaluate generalization capabilities: We collect and publish a new dataset consisting of 37.9 hours of found audio recordings of celebrities and politicians, of which 17.2 hours are deepfakes. We find that related work performs poorly on such real-world data (performance degradation of up to one thousand percent). This may suggest that the community has tailored its solutions too closely to the prevailing ASVSpoof benchmark and that deepfakes are much harder to detect outside the lab than previously thought.

研究动机与目标

  • 探究现有音频深度伪造检测模型是否能有效泛化至ASVspoof基准之外的真实世界、野外音频伪造样本。
  • 识别驱动音频伪造检测模型性能的关键架构、预处理和超参数因素。
  • 解决先前研究中在特征提取、超参数调优和评估协议方面缺乏一致性的问题。
  • 收集并发布一个包含17.2小时名人和政要深度伪造音频的高质量新数据集,以支持检测模型的真实世界评估。
  • 评估输入长度和特征类型(如melspec、cqtspec、logspec)对不同模型架构下检测性能的影响。

提出的方法

  • 使用一致的训练、验证和测试协议,重新实现并统一评估了先前工作中12种最先进的音频伪造检测架构。
  • 在保持模型架构和超参数不变的前提下,系统比较了不同特征提取技术(melspec、cqtspec和logspec)的模型性能。
  • 通过对比所有模型在完整长度音频输入与固定4秒片段上的表现,评估了输入长度的影响。
  • 从名人和政要的公开录音中收集并整理了一个包含37.9小时音频的新野外数据集,其中包含17.2小时的深度伪造音频。
  • 在ASVspoof 2019数据集和新野外数据集上分别训练并评估模型,以衡量其域泛化性能。
  • 使用标准指标:等错误率(EER)和t-DCF,对不同基准和特征类型下的模型性能进行定量比较。

实验结果

研究问题

  • RQ1现有音频深度伪造检测模型在ASVspoof基准之外的真实世界、野外音频伪造样本上的泛化程度如何?
  • RQ2在多种模型架构下,melspec、cqtspec或logspec这三种特征提取技术中,哪一种能实现最高的检测性能?
  • RQ3输入长度(固定4秒与完整音频)如何影响音频伪造检测模型的性能?
  • RQ4微调或引入ASVspoof评估集中的额外数据是否能提升模型在野外数据上的泛化能力?
  • RQ5ASVspoof上报告的高性能指标是否代表了稳健的检测能力,还是仅对合成数据分布中狭窄样本的过拟合?

主要发现

  • 在ASVspoof基准上训练的模型在新野外数据集上表现出严重性能下降,EER相比基准性能最高上升1,000%。
  • 与melspec相比,使用cqtspec或logspec特征可使平均检测性能在其他条件不变的情况下提升37%(以EER衡量)。
  • 完整长度音频输入优于固定4秒片段,将ASVspoof 2019上的EER从18.89%降低至9.85%,表明较短输入限制了模型容量。
  • 包含ASVspoof 2019“评估”数据集并未提升模型在野外数据上的泛化能力,表明来自相同源分布的数据对域外检测无益处。
  • 即使是最优模型(RawNet2)在所有ASVspoof 2019数据集上训练后,在野外数据集上EER仍高达33.1%,表明其在真实世界中鲁棒性极差。
  • 多个模型在野外数据集上的表现甚至不优于随机猜测,凸显了实验室评估与真实世界适用性之间存在的关键差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。