[论文解读] Non-intrusive speech quality assessment using neural networks
该论文提出了一种基于深度神经网络的非侵入式语音质量评估方法,训练数据来自带有真实世界失真(如噪声、混响等)的众包数据集。该方法采用梅尔频率倒谱系数(MFCC)特征,结合全连接DNN与极限学习机(ELM)后处理模块,实现了0.87的皮尔逊相关系数和0.15的均方误差,优于PESQ、P.563和SRMR在两项指标上的表现。
Estimating the perceived quality of an audio signal is critical for many multimedia and audio processing systems. Providers strive to offer optimal and reliable services in order to increase the user quality of experience (QoE). In this work, we present an investigation of the applicability of neural networks for non-intrusive audio quality assessment. We propose three neural network-based approaches for mean opinion score (MOS) estimation. We compare our results to three instrumental measures: the perceptual evaluation of speech quality (PESQ), the ITU-T Recommendation P.563, and the speech-to-reverberation energy ratio. Our evaluation uses a speech dataset contaminated with convolutive and additive noise, labeled using a crowd-based QoE evaluation, evaluated with Pearson correlation with MOS labels, and mean-squared-error of the estimated MOS. Our proposed approaches outperform the aforementioned instrumental measures, with a fully connected deep neural network using Mel-frequency features providing the best correlation (0.87) and the lowest mean squared error (0.15)
研究动机与目标
- 开发一种非侵入式、实时的语音质量评估方法,避免对干净参考信号的依赖。
- 解决现有仪器化度量方法(如PESQ和P.563)在非压缩失真(如噪声和混响)下性能不足的问题。
- 在反映日常声学损伤(如噪声、混响和房间效应)的真实众包标注数据集上训练神经网络。
- 改进以往依赖代理标签(如PESQ分数)而非主观MOS的神经网络模型。
- 评估并比较多种神经网络架构在不同声学特征下的MOS预测性能。
提出的方法
- 使用120个房间脉冲响应对语音信号进行卷积,并在45 dB SPL下添加噪声,生成了10,000个音频样本的数据集,以模拟真实世界条件。
- 评估了三种神经网络架构:基于恒Q谱特征的卷积神经网络(CNN)、基于总体可变性空间i向量的深度神经网络(DNN),以及基于梅尔频率倒谱系数(MFCC)的DNN。
- 表现最佳的模型采用梅尔频率特征作为输入,输入至四层全连接DNN,随后通过极限学习机(ELM)对音频信号的时序统计信息进行聚合。
- 模型训练采用Adam优化算法,学习率分别为0.0001和0.0004,并应用Dropout(0.2–0.5)进行正则化,以防止过拟合。
- 特征向量经过归一化处理,并通过统计池化(均值或众数)方法处理可变长度的音频输入,从而实现固定尺寸输入到神经网络。
- 性能通过与众包标注过程获得的主观MOS分数之间的皮尔逊相关系数和均方误差(MSE)进行评估。
实验结果
研究问题
- RQ1在真实世界、众包标注的语音质量数据上训练的深度神经网络,是否能在非侵入式语音质量评估中优于PESQ和P.563等标准仪器化度量方法?
- RQ2不同声学特征表示(恒Q谱、i向量和梅尔频率特征)如何影响基于神经网络的MOS估计性能?
- RQ3将深度神经网络与ELM结合以实现时序特征聚合,是否能提升MOS预测精度,相比独立的DNN模型?
- RQ4神经网络模型在多大程度上比传统度量方法更准确地捕捉人类对语音质量的感知?这些传统方法往往偏向于编码失真。
- RQ5在主观MOS分数上进行训练的非侵入式神经网络模型,是否在噪声和混响失真下的性能优于基于PESQ分数训练的模型?
主要发现
- 基于梅尔频率特征的DNN结合ELM后处理模块,实现了最高的皮尔逊相关系数0.87和最低的均方误差0.15,显著优于所有基准仪器化方法。
- 基于i向量的DNN实现了0.78的相关系数和0.22的均方误差,尽管使用了低维的说话人嵌入特征,仍表现出较强性能。
- 基于恒Q谱的CNN实现了0.72的相关系数和0.30的均方误差,表明心理声学启发的特征有效,但精度低于梅尔频率特征。
- 所有提出的神经网络模型均优于基准仪器化度量方法:PESQ(ρ=0.70,MSE=0.25)、P.563(ρ=0.55,MSE=0.36)和SRMR(ρ=0.60,MSE=0.31)。
- 结果表明,基于主观MOS数据训练的神经网络能更好地捕捉感知质量,而传统度量方法因偏向编码失真,在环境退化场景下效果较差。
- PESQ分数的分布与信噪比(SNR)的相关性更强,而非与主观MOS一致,突显了PESQ在真实场景中的关键局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。