Skip to main content
QUICK REVIEW

[论文解读] Detection of AI-Synthesized Speech Using Cepstral & Bispectral Statistics

Arun Kumar Singh, Priyanka Singh|arXiv (Cornell University)|Sep 3, 2020
Digital Media Forensic Detection参考文献 11被引用 5
一句话总结

该论文提出一种机器学习方法,通过结合倒谱和双谱特征,利用高阶谱相关性与梅尔频率倒谱系数(MFCC)及其一阶和二阶差分成分,检测AI合成语音。该方法在测试数据上对人类语音与AI生成语音的二元分类中达到97.56%的准确率,优于其他分类器,得益于二次SVM的鲁棒性以及双谱和倒谱统计量的判别能力。

ABSTRACT

Digital technology has made possible unimaginable applications come true. It seems exciting to have a handful of tools for easy editing and manipulation, but it raises alarming concerns that can propagate as speech clones, duplicates, or maybe deep fakes. Validating the authenticity of a speech is one of the primary problems of digital audio forensics. We propose an approach to distinguish human speech from AI synthesized speech exploiting the Bi-spectral and Cepstral analysis. Higher-order statistics have less correlation for human speech in comparison to a synthesized speech. Also, Cepstral analysis revealed a durable power component in human speech that is missing for a synthesized speech. We integrate both these analyses and propose a machine learning model to detect AI synthesized speech.

研究动机与目标

  • 为应对数字取证领域中AI生成语音深度伪造和伪造音频日益增长的威胁。
  • 开发一种鲁棒方法,利用高阶统计特征区分人类语音与AI合成语音。
  • 整合倒谱与双谱分析,利用真实语音与合成语音在谱相关性和功率分量上的固有差异。
  • 在未经清理的噪声音频上评估模型,以确保其在真实场景中的适用性。

提出的方法

  • 该方法使用双谱分析,通过归一化双谱(双相干函数)提取三阶相关性,聚焦于幅度和相位,以检测人类语音中不存在的非高斯、非随机相关性。
  • 应用梅尔频率倒谱分析提取MFCC、一阶倒谱差分(∆-倒谱)和二阶倒谱差分(∆²-倒谱),以捕捉AI生成语音中缺失的声道特征。
  • 将双谱分析与倒谱分析提取的特征整合为统一的特征向量用于分类。
  • 采用二次支持向量机(Q-SVM)作为分类器,因其在五折交叉验证中表现更优,且具备基于核函数的泛化能力。
  • 模型在来自多个来源(如Google AI、Siri、NaturalReader、Spik.AI、Replica)的多样化人类语音与AI合成语音数据集上进行训练和测试,包含噪声和未经清理的音频。
  • 通过混淆矩阵和准确率指标,在二元分类(人类 vs. AI)和多分类(源特定)设置下评估性能。

实验结果

研究问题

  • RQ1双谱分析所捕获的高阶谱相关性是否能有效区分AI合成语音与人类语音?
  • RQ2倒谱特征(包括MFCC、∆-倒谱和∆²-倒谱)是否具备检测合成语音的判别能力?
  • RQ3结合双谱与倒谱特征是否能提升检测准确率,相较于单独使用任一特征集?
  • RQ4该模型在未经预处理的真实世界噪声音频数据上的表现如何?
  • RQ5二元分类(人类 vs. AI)在检测合成语音时是否比多分类(源特定AI模型)更准确?

主要发现

  • 所提方法在测试集上对人类语音与AI合成语音的二元分类中达到97.56%的准确率,误分类率为2.43%。
  • 二次SVM分类器优于所有其他模型,在二元分类中达到96.3%的准确率,在多分类中达到96.1%的准确率(交叉验证结果)。
  • 双谱分析成功检测到AI合成语音中存在但人类语音中缺失的三阶相关性,构成关键判别特征。
  • 倒谱分析揭示了人类语音中持久存在的能量分量,而AI合成语音中缺失,进一步增强了判别能力。
  • 二元分类的混淆矩阵显示误分类极少,仅1个真实人类语音样本被错误分类为AI,表明模型具有强大的泛化能力。
  • 多分类准确率达到93.9%,但相似AI模型之间(如NaturalReader与Spik.AI)误报率较高,证实二元分类在实际检测中更具鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。