Skip to main content
QUICK REVIEW

[论文解读] On Psychoacoustically Weighted Cost Functions Towards Resource-Efficient Deep Neural Networks for Speech Denoising

Kai Zhen, Aswin Sivaraman|arXiv (Cornell University)|Jan 29, 2018
Speech and Audio Processing参考文献 17被引用 3
一句话总结

本文提出了一种心理声学加权代价函数,通过强调人类最敏感的频率子带,利用PAM-1模型的掩蔽阈值,提升了基于深度神经网络(DNN)的语音去噪中的感知质量。该方法使更简单、资源效率更高的DNN能够维持高感知质量,尽管模型复杂度降低,其在感知指标上的表现仍优于标准MSE训练的模型。

ABSTRACT

We present a psychoacoustically enhanced cost function to balance network complexity and perceptual performance of deep neural networks for speech denoising. While training the network, we utilize perceptual weights added to the ordinary mean-squared error to emphasize contribution from frequency bins which are most audible while ignoring error from inaudible bins. To generate the weights, we employ psychoacoustic models to compute the global masking threshold from the clean speech spectra. We then evaluate the speech denoising performance of our perceptually guided neural network by using both objective and perceptual sound quality metrics, testing on various network structures ranging from shallow and narrow ones to deep and wide ones. The experimental results showcase our method as a valid approach for infusing perceptual significance to deep neural network operations. In particular, the more perceptually sensible enhancement in performance seen by simple neural network topologies proves that the proposed method can lead to resource-efficient speech denoising implementations in small devices without degrading the perceived signal fidelity.

研究动机与目标

  • 解决在移动或嵌入式系统等资源受限设备中部署复杂DNN进行语音去噪的挑战。
  • 在不增加网络复杂度的前提下,通过利用人类听觉感知提升去噪语音的感知质量。
  • 开发一种代价函数,优先考虑感知显著的频率分量,同时最小化不可听区域的误差。
  • 评估感知引导训练是否能使更简单的网络架构实现与更深、更大的模型相当的感知性能。
  • 证明感知加权可实现更高效的DNN,而不会损失感知音频保真度。

提出的方法

  • 该方法使用PAM-1心理声学模型从干净语音谱图计算全局掩蔽阈值,识别感知不相关的频率子带。
  • 从掩蔽阈值推导出感知权重,并将其应用于均方误差(MSE)损失函数,突出可听频率区域的误差。
  • 加权代价函数定义为感知加权MSE,其中每个频率子带的贡献按其感知重要性进行缩放。
  • 使用Adam优化器在TensorFlow中训练5,000个周期,对比12种不同网络架构下加权与未加权损失函数的性能。
  • 客观评估采用BSS-Eval指标(SDR、SIR、SAR),感知评估采用PEASS和STOI进行感知质量评估。
  • 模型复杂度从浅层(如256×2)到深层(如1024×3)变化,支持不同网络结构间的性能比较。

实验结果

研究问题

  • RQ1感知加权代价函数是否能在降低模型复杂度的同时提升DNN语音去噪的感知质量?
  • RQ2感知加权在不同网络架构下对SDR、SIR和SAR等客观指标有何影响?
  • RQ3与更深、更宽的模型相比,所提出方法在浅层和窄层网络中在多大程度上保持了感知质量?
  • RQ4在损失函数中使用心理声学掩蔽阈值是否能实现更高效的参数利用而不造成感知质量下降?
  • RQ5感知加权是否能减少实时嵌入式语音增强应用中对大型、计算密集型DNN的需求?

主要发现

  • 感知加权DNN即使参数显著减少,其感知质量(OPS)仍与未加权模型相当或更优。
  • 尽管SIR略有下降(约0.5 dB),但加权模型引入的感知干扰性失真更少,表现为APS得分更高。
  • 加权模型的STOI得分略高,表明语音可懂度稳定或有所改善。
  • 使用感知代价函数的浅层和窄层网络在复杂度受限条件下,其感知质量优于更深的模型。
  • 该方法通过减少对大型复杂DNN的依赖,实现了资源高效的实现,且未造成感知质量损失。
  • 所提方法表明,将心理声学模型整合到训练目标中,可实现更高效且感知鲁棒的语音去噪系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。