Skip to main content
QUICK REVIEW

[论文解读] A Hybrid DSP/Deep Learning Approach to Real-Time Full-Band Speech Enhancement

Jean-Marc Valin|arXiv (Cornell University)|Sep 24, 2017
Speech and Audio Processing被引用 4
一句话总结

本文提出一种混合DSP/深度学习方法,用于实时全频带(48 kHz)语音增强,采用四层循环神经网络(RNN)估计22个Bark尺度频带的理想临界带增益(ICBG),并结合基 pitch comb滤波器以抑制谐波之间的噪声。该方法在保持低计算复杂度、适合在低功耗CPU上实时部署的同时,显著提升了语音质量,优于传统的MMSE方法。

ABSTRACT

Despite noise suppression being a mature area in signal processing, it remains highly dependent on fine tuning of estimator algorithms and parameters. In this paper, we demonstrate a hybrid DSP/deep learning approach to noise suppression. A deep neural network with four hidden layers is used to estimate ideal critical band gains, while a more traditional pitch filter attenuates noise between pitch harmonics. The approach achieves significantly higher quality than a traditional minimum mean squared error spectral estimator, while keeping the complexity low enough for real-time operation at 48 kHz on a low-power processor.

研究动机与目标

  • 为解决传统噪声抑制算法长期存在的调参难题,这些算法依赖于复杂且需人工调优的噪声功率与谱增益估计器。
  • 在保持高质量输出的同时,降低全频带语音增强的计算复杂度,使其适用于视频会议等实时应用。
  • 结合成熟DSP技术的鲁棒性与深度学习的自适应学习能力,聚焦于人工难以调优的组件。
  • 证明轻量级深度学习模型可在不依赖高端硬件的前提下,显著提升语音质量,超越传统MMSE方法。

提出的方法

  • 四层循环神经网络(RNN)用于估计22个Bark尺度频带的理想临界带增益(ICBG),输出限制在0到1之间,从而减少对高维谱估计的需求。
  • 网络以20 ms帧长、50%重叠处理信号,使用满足Princen-Bradley准则的Vorbis窗,确保完美重构。
  • 通过三角带权重在频率点间进行加权插值,实现每频带增益的平滑谱形变。
  • 在频域应用基pitch comb滤波器,利用频带特定系数抑制谐波之间的噪声,基于周期性估计实现。
  • 通过递归滤波器应用增益平滑,时间常数λ=0.6,防止输出过度干燥并保留自然混响。
  • 模型采用均方误差损失估计ICBG,结合语音活动检测(VAD)的交叉熵损失,对低能量帧使用掩码损失。

实验结果

研究问题

  • RQ1轻量级深度学习模型能否有效替代传统噪声抑制流程中最难调优的组件?
  • RQ2将低分辨率深度学习增益估计器与基于基pitch的滤波器结合,是否优于传统的MMSE谱估计方法?
  • RQ3此类混合系统能否在低功耗CPU上实现实时运行,同时保持低计算复杂度与高质量语音增强?
  • RQ4与传统仅依赖DSP的方法相比,该方法在非平稳噪声环境下能将语音质量提升多少?

主要发现

  • 在babble、car和street噪声条件下,PESQ MOS-LQO评分均显示,该方法显著优于SpeexDSP中的MMSE噪声抑制器。
  • 系统可在低功耗CPU上以48 kHz实时运行,仅占用单个x86核心(Haswell i7-4800MQ)的1.3%,以及Raspberry Pi 3的ARM Cortex-A53核心的14%。
  • 总计算复杂度约为40 Mflops,与全带语音编码器相当,且模型的87,503个权重可无性能损失地量化为8位。
  • 采用λ=0.6的增益平滑有效防止输出过度干燥,保留自然混响,有效衰减时间达135 ms。
  • 该方法可通过在输入特征中增加远端信号特性,轻松扩展至残留回声抑制与麦克风阵列后处理滤波。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。