Skip to main content
QUICK REVIEW

[论文解读] A Spoofing Benchmark for the 2018 Voice Conversion Challenge: Leveraging from Spoofing Countermeasures for Speech Artifact Assessment

Tomi Kinnunen, Jaime Lorenzo-Trueba|arXiv (Cornell University)|Apr 23, 2018
Speech Recognition and Synthesis参考文献 6被引用 3
一句话总结

本文提出将欺骗检测反制措施(CMs)作为一种无参考、无目标的客观方法,用于评估语音转换(VC)系统中的语音失真。通过训练基于常数Q倒谱系数(CQCC)的CM,以区分真实语音与转换后的语音,其等错误率(EER)可作为失真严重程度的代理指标——EER越低,表示失真越易被检测。主要发现为:VCC'18中的所有系统均未达到50%的EER(理想值),表明所有系统均引入了可测量的失真,其中基于Wavenet的系统尽管主观质量优异,但其失真仍具有高度可检测性。

ABSTRACT

Voice conversion (VC) aims at conversion of speaker characteristic without altering content. Due to training data limitations and modeling imperfections, it is difficult to achieve believable speaker mimicry without introducing processing artifacts; performance assessment of VC, therefore, usually involves both speaker similarity and quality evaluation by a human panel. As a time-consuming, expensive, and non-reproducible process, it hinders rapid prototyping of new VC technology. We address artifact assessment using an alternative, objective approach leveraging from prior work on spoofing countermeasures (CMs) for automatic speaker verification. Therein, CMs are used for rejecting `fake' inputs such as replayed, synthetic or converted speech but their potential for automatic speech artifact assessment remains unknown. This study serves to fill that gap. As a supplement to subjective results for the 2018 Voice Conversion Challenge (VCC'18) data, we configure a standard constant-Q cepstral coefficient CM to quantify the extent of processing artifacts. Equal error rate (EER) of the CM, a confusability index of VC samples with real human speech, serves as our artifact measure. Two clusters of VCC'18 entries are identified: low-quality ones with detectable artifacts (low EERs), and higher quality ones with less artifacts. None of the VCC'18 systems, however, is perfect: all EERs are < 30 % (the `ideal' value would be 50 %). Our preliminary findings suggest potential of CMs outside of their original application, as a supplemental optimization and benchmarking tool to enhance VC technology.

研究动机与目标

  • 解决现有语音转换(VC)质量评估中缺乏标准化客观指标的问题,超越主观听音测试。
  • 探索原本用于自动说话人验证中防欺骗的欺骗检测反制措施(CMs)是否可被重新用于VC中的客观失真评估。
  • 为VC系统基准测试提供一种无参考、与文本无关的替代主观MOS评分的方法。
  • 评估CM-based EER与VCC'18挑战中主观质量评分(MOS)之间的相关性。
  • 利用CM识别哪些VC方法产生的失真更易或更难被检测,特别是针对Wavenet等新型技术。

提出的方法

  • 使用标准的常数Q倒谱系数(CQCC)前端,从转换后的语音和真实人声中提取声学特征。
  • 使用高斯混合模型(GMM)后端训练分类器,将输入语音序列分类为真实(bona fide)或欺骗(转换)语音。
  • 计算训练后CM的等错误率(EER)作为性能指标,EER越低表示失真越易被检测。
  • 在VCC'18挑战的参赛系统输出上评估CM,包括基线和挑战系统输出,其中EER作为客观失真评分。
  • 该方法在不访问源说话人波形或文本转录的情况下应用,因此为无参考且与文本无关。
  • 将EER与VCC'18主观感知测试中的人类MOS评分进行比较,以评估机器感知与人类感知之间的互补性。

实验结果

研究问题

  • RQ1欺骗检测反制措施能否被有效重新用于评估语音转换系统中的语音失真?
  • RQ2在VCC'18数据上训练的CM的EER与人类听觉感知的主观质量评分(MOS)之间有何相关性?
  • RQ3根据CM-based EER指标,哪些VC系统产生的失真最易或最不易被检测?
  • RQ4现代VC技术(如基于Wavenet的合成)在引入感知自然的语音的同时,其失真在多大程度上仍可被CM检测到?
  • RQ5CM-based EER能否作为耗时的主观评估的可靠、可复现且高效的替代方案,用于VC基准测试?

主要发现

  • 所有VCC'18系统均产生了可检测的失真,表现为EER值低于理想值50%,无一能完全‘欺骗’CM。
  • 采用波形滤波、SuperVP以及Griffin-Lim-based生成的系统表现出更低的EER(性能更优),表明其失真更难被检测。
  • 尽管MOS评分较高,基于Wavenet的系统仍表现出相对较高的EER,表明其引入的失真虽不具感知明显性,但可被机器模型检测到。
  • EER指标对特征选择和模型配置表现出敏感性,表明CM性能依赖于训练和超参数的选择。
  • CM-based EER与主观MOS之间无强相关性,证实人类与机器对语音质量的感知存在显著差异。
  • 本研究揭示了一个差距:当前最先进的VC系统虽能‘欺骗’人类听觉感知,但未必能‘欺骗’反制检测系统,表明在失真最小化方面仍有改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。