Skip to main content
QUICK REVIEW

[论文解读] The DKU-DUKEECE System for the Manipulation Region Location Task of ADD 2023

Zexin Cai, Weiqing Wang|arXiv (Cornell University)|Aug 20, 2023
Music and Audio ProcessingComputer Science被引用 3
一句话总结

本论文提出了 DKU-DUKEECE 系统,在 Audio Deepfake Detection Challenge 2023 Track 2 中通过融合波形边界检测模型、帧级反欺骗检测器和基于 VAE 的异常检测器,实现了最先进性能。该系统在测试集上取得 82.23% 的句子准确率和 60.66% 的 F₁ 分数,整体 ADD 得分为 0.6713,获得第一名。

ABSTRACT

This paper introduces our system designed for Track 2, which focuses on locating manipulated regions, in the second Audio Deepfake Detection Challenge (ADD 2023). Our approach involves the utilization of multiple detection systems to identify splicing regions and determine their authenticity. Specifically, we train and integrate two frame-level systems: one for boundary detection and the other for deepfake detection. Additionally, we employ a third VAE model trained exclusively on genuine data to determine the authenticity of a given audio clip. Through the fusion of these three systems, our top-performing solution for the ADD challenge achieves an impressive 82.23% sentence accuracy and an F1 score of 60.66%. This results in a final ADD score of 0.6713, securing the first rank in Track 2 of ADD 2023.

研究动机与目标

  • 解决在部分伪造音频片段中定位篡改区域的挑战,该任务比简单的真伪分类更为复杂。
  • 开发一个鲁棒系统,能够检测拼接边界,并在分布外音频数据中识别伪造片段。
  • 通过整合多种互补的检测机制,克服现有反欺骗模型在特定合成系统上训练后泛化能力有限的问题。
  • 通过结合监督学习与自监督学习及异常检测,提升在未见、分布不匹配领域中的检测性能。
  • 通过融合多个模型并采用基于启发式规则的评分策略,在 ADD 2023 挑战赛中实现顶尖性能。

提出的方法

  • 训练一个基于 WavLM 的边界检测模型,利用帧级标签识别拼接音频片段中的连接点。
  • 通过重新定义输出标签,将边界检测模型重新用于帧级反欺骗检测,将每一帧分类为真实或伪造。
  • 利用基于 Wav2Vec 的帧级反欺骗模型,基于学习到的表征评估单个音频帧的真实性。
  • 仅在真实音频样本上训练 VAE 模型,以检测与真实语音分布偏差较大的异常样本。
  • 采用启发式评分策略融合三个模型的输出:对具有 1–3 个边界的片段使用边界检测与反欺骗检测结果;对边界数为 0 或超过 10 个的模糊情况,使用 VAE 的异常得分重新评分。
  • 应用基于阈值的决策规则:若一个片段中超过 40% 的帧被预测为伪造,则将该片段分类为伪造;否则分类为真实。

实验结果

研究问题

  • RQ1当训练数据与测试数据来自不匹配的合成模型时,系统如何有效定位部分伪造音频片段中的篡改区域?
  • RQ2边界检测、帧级反欺骗检测与异常检测的组合在分布外音频上的泛化能力可提升到何种程度?
  • RQ3在音频拼接伪造检测背景下,如何实现对多种具有不同优势的检测模型的最优融合策略?
  • RQ4仅在真实数据上训练的 VAE 是否能有效识别与真实语音分布显著偏离的伪造音频片段?
  • RQ5基于片段长度与伪造帧比例的启发式规则,如何在模型预测模糊时提升分类准确率?

主要发现

  • DKU-DUKEECE 系统在 ADD 2023 Track 2 测试集上取得 82.23% 的句子准确率,表明其在识别正确篡改区域方面具有高精度。
  • 该系统获得 60.66% 的 F₁ 分数,表明在检测伪造片段时,精确率与召回率保持良好平衡。
  • 最终融合模型结合基于 VAE 的异常检测,整体 ADD 得分为 0.6713,在 ADD 2023 Track 2 中排名第一。
  • 在集成 VAE 之前,基于 WavLM 的边界检测与基于 Wav2Vec 的反欺骗检测模型组合已取得 0.6538 的基础 ADD 得分。
  • VAE 模型通过重新评分模糊案例(特别是检测到 0 个或超过 10 个边界的语音片段)显著提升了性能,将最偏离的 45% 样本识别为伪造。
  • 基于启发式的评分策略——当两个片段的伪造帧比例相近时,将较短的片段判定为伪造——在处理模糊的双片段情况时表现有效,其依据来自训练集的先验信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。