Skip to main content
QUICK REVIEW

[论文解读] Spoofing detection under noisy conditions: a preliminary investigation and an initial database

Xiaohai Tian, Zhizheng Wu|arXiv (Cornell University)|Feb 9, 2016
Speech Recognition and Synthesis参考文献 12被引用 9
一句话总结

本文引入了一个带有五类附加噪声(白噪声、人声嘈杂、沃尔沃车内、街道、咖啡厅)的嘈杂ASVspoof数据库,信噪比(SNR)分别为20 dB、10 dB和0 dB,并在噪声条件下评估了当前最先进的语音欺骗检测特征。结果表明,模型性能在噪声环境下显著下降,尤其在低信噪比时更为明显,基于相位的特征(IF、BPD)优于基于幅度的特征,且非平稳噪声(如沃尔沃和咖啡厅噪声)造成的性能下降程度高于白噪声。

ABSTRACT

Spoofing detection for automatic speaker verification (ASV), which is to discriminate between live speech and attacks, has received increasing attentions recently. However, all the previous studies have been done on the clean data without significant additive noise. To simulate the real-life scenarios, we perform a preliminary investigation of spoofing detection under additive noisy conditions, and also describe an initial database for this task. The noisy database is based on the ASVspoof challenge 2015 database and generated by artificially adding background noises at different signal-to-noise ratios (SNRs). Five different additive noises are included. Our preliminary results show that using the model trained from clean data, the system performance degrades significantly in noisy conditions. Phase-based feature is more noise robust than magnitude-based features. And the systems perform significantly differ under different noise scenarios.

研究动机与目标

  • 研究当前欺骗检测系统在加性噪声环境下的鲁棒性,此类环境在真实世界的ASV部署中十分常见。
  • 基于ASVspoof 2015数据集构建并发布一个初始的嘈杂数据库,通过在多个SNR水平下添加五种逼真的加性噪声类型。
  • 在噪声环境中基准化当前最先进的欺骗检测特征(基于幅度和基于相位)的性能。
  • 识别出对欺骗检测性能造成最严重下降的噪声类型,并理解信噪比(SNR)对系统可靠性的影响。

提出的方法

  • 通过在ASVspoof 2015数据库中人工添加五类加性噪声(白噪声、人声嘈杂、沃尔沃车内、街道、咖啡厅噪声)构建了其嘈杂版本,信噪比(SNR)分别为20 dB、10 dB和0 dB。
  • 从现有数据库中选取噪声信号:NOISEX-92(白噪声、人声嘈杂、沃尔沃车内)和QUT-NOISE(街道、咖啡厅)以代表真实的现实声学环境。
  • 采用标准的欺骗检测流程,使用12种特征:6种基于幅度的特征(LPC、LPCC、MFCC、RASTA、PLP、RLMS)和6种基于相位的特征(IF、BPD、GD、MGD、LPS、LPSF)。
  • 在干净数据上训练基于高斯混合模型(GMM)的分类器,并在所有噪声类型和SNR水平下评估其在嘈杂数据库上的性能。
  • 以等错误率(EER)为主要评估指标,并通过特征得分融合提升检测性能。
  • 通过比较不同噪声类型和SNR水平下的EER,分析特征鲁棒性,并评估不同欺骗攻击类型(S1-S10)之间的性能差异。

实验结果

研究问题

  • RQ1当前最先进的欺骗检测算法在加性噪声条件下是否仍能有效运行?
  • RQ2信噪比(SNR)如何影响不同噪声类型下的欺骗检测性能?
  • RQ3哪些类型的加性噪声对欺骗检测性能造成最严重的下降?
  • RQ4在欺骗检测中,基于相位的特征是否比基于幅度的特征更具抗噪鲁棒性?
  • RQ5在噪声环境中,不同欺骗攻击类型(如S1-S5与S6-S10)的性能表现有何差异?

主要发现

  • 所有噪声条件下系统性能均显著下降,其中0 dB SNR时下降最为严重,评估集上沃尔沃噪声下的EER最高达14.31%。
  • 即使在有利条件(20 dB SNR)下,性能最佳的系统(白噪声)在开发集上的EER仍为2.52%,低于干净条件下的基准性能。
  • 基于相位的特征(IF、BPD)在所有噪声类型和SNR水平下均持续优于基于幅度的特征,且IF和BPD实现了最低的平均EER。
  • 非平稳噪声(如沃尔沃车内、街道、咖啡厅噪声)导致的EER显著高于平稳白噪声,表明对欺骗检测系统构成更大挑战。
  • S10攻击在干净和噪声条件下均最难检测,其EER远高于S1-S9,即使在得分融合后仍保持较高水平。
  • 得分融合在所有噪声场景下均提升了性能,但在低SNR和非平稳噪声条件下增益有限,表明亟需采用抗噪鲁棒的训练策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。