Skip to main content
QUICK REVIEW

[论文解读] Neural MOS Prediction for Synthesized Speech Using Multi-Task Learning With Spoofing Detection and Spoofing Type Classification

Yeunju Choi, Youngmoon Jung|arXiv (Cornell University)|Jul 16, 2020
Speech Recognition and Synthesis参考文献 31被引用 4
一句话总结

本文提出一种多任务学习框架,通过联合训练语音欺骗检测(SD)和欺骗类型分类(STC)作为辅助任务,提升了合成语音的神经网络平均意见得分(MOS)预测性能。采用焦点损失(focal loss)平衡SD训练,模型在MOS预测准确率上相比基线模型最高提升11.6%,表明其泛化能力更强,且对评分者差异更具鲁棒性。

ABSTRACT

Several studies have proposed deep-learning-based models to predict the mean opinion score (MOS) of synthesized speech, showing the possibility of replacing human raters. However, inter- and intra-rater variability in MOSs makes it hard to ensure the high performance of the models. In this paper, we propose a multi-task learning (MTL) method to improve the performance of a MOS prediction model using the following two auxiliary tasks: spoofing detection (SD) and spoofing type classification (STC). Besides, we use the focal loss to maximize the synergy between SD and STC for MOS prediction. Experiments using the MOS evaluation results of the Voice Conversion Challenge 2018 show that proposed MTL with two auxiliary tasks improves MOS prediction. Our proposed model achieves up to 11.6% relative improvement in performance over the baseline model.

研究动机与目标

  • 解决主观MOS评估中评分者间与评分者内差异性带来的挑战,该问题限制了现有神经网络MOS预测模型的性能。
  • 通过利用相关辅助任务(即语音欺骗检测(SD)和欺骗类型分类(STC)),提升MOS预测模型的泛化能力和鲁棒性。
  • 探索SD与STC在多任务学习中的协同作用,以增强MOS预测的特征学习能力。
  • 研究焦点损失在平衡语音欺骗检测中难样本与易样本学习动态方面的影响,尤其是在领域偏移情况下的表现。
  • 证明辅助任务可在无需人工评分者参与的情况下提升MOS预测性能,从而实现系统的自动化对比。

提出的方法

  • 采用基于CNN-BLSTM的MOSNet作为基线模型,使用257维幅度谱图作为输入,进行话语级别的MOS预测。
  • 引入两个辅助任务:二分类语音欺骗检测(SD),用于将语音分类为真人或合成语音;以及欺骗类型分类(STC),用于识别合成语音的来源系统。
  • 使用多任务损失函数联合训练,该函数结合了话语级和帧级MOS预测的均方误差(MSE)损失、SD的交叉熵损失以及STC的交叉熵损失。
  • 在SD分支中应用焦点损失,以降低易样本负样本的影响,提升对难样本的学习效果,尤其是在领域偏移情况下。
  • 在所有任务中共享编码器层,以实现特征迁移,同时为MOS、SD和STC预测分别设计任务特定的头结构。
  • 使用t-SNE可视化共享特征,分析辅助任务在特征空间中产生的集中、忽略与区分效应。

实验结果

研究问题

  • RQ1语音欺骗检测与欺骗类型分类能否作为有效辅助任务,以提升合成语音的神经网络MOS预测性能?
  • RQ2在语音欺骗检测中使用焦点损失,对MOS预测性能有何影响,尤其是在领域偏移情况下的表现?
  • RQ3辅助任务在多大程度上提升了MOS预测模型在不同评分者群体与不同欺骗类型下的泛化能力?
  • RQ4辅助任务产生的集中、忽略与区分效应,对学习到的共享特征表示有何影响?
  • RQ5所提出的多任务学习框架在准确率与鲁棒性方面是否优于当前最先进水平的MOS预测模型?

主要发现

  • 所提出的结合语音欺骗检测与欺骗类型分类的多任务学习模型,在MOS预测性能上相比基线MOSNet模型最高实现11.6%的相对提升。
  • 采用焦点损失的语音欺骗检测显著提升了泛化能力,尤其在存在领域偏移的VCC’16数据集上,有效缓解了对难样本的忽略问题。
  • 引入欺骗类型分类增强了特征的区分能力,t-SNE可视化显示,来自不同系统的语音帧聚类更加清晰。
  • t-SNE图中观察到语音欺骗检测具有集中效应,即真人语音与高质量合成语音帧与低质量语音帧的分离更明显。
  • 在VCC’18与VCC’16数据集上,采用焦点损失的语音欺骗检测(SD w/ FL)均优于标准SD,尤其显著降低了易负样本对学习的负面影响。
  • 所提出模型超越了当前最先进水平的MOSNet+EL模型,证实了联合学习SD与STC在自动化语音质量评估中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。