Skip to main content
QUICK REVIEW

[论文解读] Perceptual audio loss function for deep learning

D. Elbaz, Michael Zibulevsky|arXiv (Cornell University)|Aug 20, 2017
Speech and Audio Processing参考文献 3被引用 4
一句话总结

该论文提出了一种基于Wavenet架构的可微分、可学习的感知音频损失函数,用于近似PESQ语音质量度量。通过在干净-受损语音对上训练Wavenet模型以预测PESQ分数,该方法实现了与人类主观质量感知更一致的端到端语音增强,在0.25秒音频片段上与完整段落PESQ的相关性达到81%。

ABSTRACT

PESQ and POLQA , are standards are standards for automated assessment of voice quality of speech as experienced by human beings. The predictions of those objective measures should come as close as possible to subjective quality scores as obtained in subjective listening tests. Wavenet is a deep neural network originally developed as a deep generative model of raw audio wave-forms. Wavenet architecture is based on dilated causal convolutions, which exhibit very large receptive fields. In this short paper we suggest using the Wavenet architecture, in particular its large receptive filed in order to learn PESQ algorithm. By doing so we can use it as a differentiable loss function for speech enhancement.

研究动机与目标

  • 开发一种与主观语音质量相关联的可微分损失函数,具体模拟PESQ度量。
  • 解决MSE和PSNR等标准损失函数与人类MOS评分相关性差的局限性。
  • 利用Wavenet中扩张因果卷积的大型感受野,建模语音信号中的长期时间依赖性。
  • 通过感知启发的、可微分的损失函数,实现语音增强模型的端到端训练。
  • 通过在优化过程中结合学习到的PESQ损失与MSE损失,提升语音增强的保真度。

提出的方法

  • 使用来自全参考算法的真实PESQ值,训练Wavenet模型预测0.25秒干净-受损语音对的PESQ分数。
  • 对干净和受损信号均使用16 kHz采样、4095个样本(0.25秒)的音频输入。
  • 通过语音者身份对Wavenet模型进行条件控制,以提高每名语音者的预测精度,并实现单个模型支持多个语音者。
  • 利用Wavenet的扩张因果卷积,实现8190个样本的感受野,捕捉PESQ类评估中至关重要的长程依赖性。
  • 将训练好的Wavenet作为可微分损失函数应用于语音增强,通过加权和的方式与MSE损失结合:$ P(x_{\text{clean}}, x_{\text{degraded}}) + \lambda \cdot \text{MSE}(x_{\text{clean}}, x_{\text{degraded}}) $。
  • 在TIMIT语料库上进行模型训练,受损音频通过随机相位傅里叶变换生成语音 shaped 噪声。

实验结果

研究问题

  • RQ1具有大感受野的深度神经网络能否以可微分方式近似PESQ语音质量度量?
  • RQ2在短音频片段(0.25秒)上训练的基于Wavenet的模型与完整段落PESQ分数的相关性如何?
  • RQ3与标准的MSE或PSNR损失相比,学习到的感知损失在多大程度上能提升语音增强质量?
  • RQ4对语音者身份进行条件控制能否提高学习到的PESQ预测器的准确性和泛化能力?
  • RQ5是否可行使用深度学习模型在端到端训练流程中替代或模拟非可微分的PESQ算法?

主要发现

  • 在0.25秒音频片段上评估时,基于Wavenet的模型与完整段落PESQ分数的相关性达到81%。
  • 该模型通过其8190个样本的大感受野成功学习到捕捉长期时间依赖性,从而预测PESQ分数。
  • 对语音者身份进行条件控制提升了模型在TIMIT数据集中跨不同语音者泛化的能力。
  • 学习到的PESQ损失函数是可微分的,可集成到语音增强模型的端到端训练中。
  • 将学习到的感知损失与MSE损失结合,可实现更符合主观质量感知的优化,优于仅使用MSE。
  • 该方法表明,深度学习能够以可训练的形式有效近似PESQ等复杂、非可微分的客观质量度量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。