Skip to main content
QUICK REVIEW

[论文解读] MetricNet: Towards Improved Modeling For Non-Intrusive Speech Quality Assessment

Meng Yu, Chunlei Zhang|arXiv (Cornell University)|Apr 2, 2021
Speech and Audio Processing参考文献 27被引用 5
一句话总结

MetricNet 提出了一种新颖的非侵入式语音质量评估模型,结合使用地球移动距离(EMD)的标签分布学习与联合语音重建学习,以提升性能。通过将 PESQ 分数建模为软标签分布,并联合训练语音重建,MetricNet 将均方误差(MSE)降低了 28%,并与真实 PESQ 的相关性显著高于当前最先进基线模型。

ABSTRACT

The objective speech quality assessment is usually conducted by comparing received speech signal with its clean reference, while human beings are capable of evaluating the speech quality without any reference, such as in the mean opinion score (MOS) tests. Non-intrusive speech quality assessment has attracted much attention recently due to the lack of access to clean reference signals for objective evaluations in real scenarios. In this paper, we propose a novel non-intrusive speech quality measurement model, MetricNet, which leverages label distribution learning and joint speech reconstruction learning to achieve significantly improved performance compared to the existing non-intrusive speech quality measurement models. We demonstrate that the proposed approach yields promisingly high correlation to the intrusive objective evaluation of speech quality on clean, noisy and processed speech data.

研究动机与目标

  • 解决现有非侵入式语音质量评估模型依赖不可微、手工设计特征及标准回归损失的局限性。
  • 通过将语音信号重建整合到端到端学习框架中,提升建模保真度,以实现更优的失真程度估计。
  • 通过用地球移动距离(EMD)替代标准 MSE/MAE 损失,实现标签分布学习,从而提升训练稳定性和性能。
  • 引入斯皮尔曼等级相关系数(SRCC)作为补充目标,以保持语音样本间预测质量排序的一致性。
  • 在干净、嘈杂、混响及处理过的语音数据上实现优越的泛化能力,包括未见过的失真类型。

提出的方法

  • MetricNet 采用深层神经网络架构,包含使用 1×1 卷积和深度可分离卷积的残差块(ConvBlocks),并结合 PReLU 激活函数与归一化层。
  • 通过将连续的 PESQ 分数离散化为 N 个类别的分布(N=100 或 500),实现标签分布学习,软标签由高斯核推导,以建模类别间的关联关系。
  • 训练目标结合了用于标签分布学习的 EMD 损失,以及来自独立语音重建分支的重建损失,用于从降质输入中重建干净语音。
  • 引入斯皮尔曼等级相关系数(SRCC)损失,以保持预测得分与真实 PESQ 排名之间的相对顺序。
  • 模型采用多任务端到端训练:最小化预测标签分布与目标标签分布之间的 EMD,同时重建干净语音并保持等级一致性。
  • 该架构在大规模、多样化的数据集上进行评估,包含干净、嘈杂、混响及处理过的语音,同时引入扰动谱图以测试鲁棒性。

实验结果

研究问题

  • RQ1将 PESQ 分数建模为基于地球移动距离(EMD)的软标签分布,是否能优于标准回归方法,提升非侵入式语音质量评估性能?
  • RQ2联合学习语音重建是否能增强模型对质量失真程度的估计能力?
  • RQ3将斯皮尔曼等级相关系数(SRCC)作为训练目标,对模型性能与泛化能力有何影响?
  • RQ4所提出的训练准则(EMD + 重建 + SRCC)是否在多种语音失真类型上优于基于标准 MSE/MAE 的方法?
  • RQ5该模型能否对通过谱图扰动引入的未见失真类型实现良好泛化?

主要发现

  • 与最佳基线(带帧正则化的 Quality-Net)相比,MetricNet 在扰动测试数据上将均方误差(MSE)降低了 28%,达到 MSE=0.060。
  • 在测试集上,模型实现了 0.94 的线性相关系数(LCC)和 0.92 的斯皮尔曼等级相关系数(SRCC),表明与真实 PESQ 分数高度一致。
  • 使用 EMD 损失的标签分布学习优于最大似然预测,尤其在采用更细粒度量化(N=500)和软标签时表现更优。
  • 引入语音重建学习带来了明显的性能提升,预测分布更加清晰,归因于重建目标的优化。
  • 当与标签分布学习结合时,等级相关系数损失提供了细微但一致的性能改进;然而,当同时存在重建任务时,其增益不再显著。
  • 模型在扰动数据上保持了强劲性能,MSE 从基线的 0.079 降低至 MetricNet 的 0.060,表明对未见失真具有强大鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。