[论文解读] DeepFilterNet2: Towards Real-Time Speech Enhancement on Embedded Devices for Full-Band Audio
DeepFilterNet2 是一种轻量级、两阶段的语音增强框架,通过利用语音谐波的感知建模和优化训练,在全频带(48 kHz)音频上实现了实时推理的最先进性能。其在 Core-i5 CPU 上的实时因子(RTF)降低至 0.04,并可在树莓派 4 等嵌入式设备上部署,实时因子为 0.42。
Deep learning-based speech enhancement has seen huge improvements and recently also expanded to full band audio (48 kHz). However, many approaches have a rather high computational complexity and require big temporal buffers for real time usage e.g. due to temporal convolutions or attention. Both make those approaches not feasible on embedded devices. This work further extends DeepFilterNet, which exploits harmonic structure of speech allowing for efficient speech enhancement (SE). Several optimizations in the training procedure, data augmentation, and network structure result in state-of-the-art SE performance while reducing the real-time factor to 0.04 on a notebook Core-i5 CPU. This makes the algorithm applicable to run on embedded devices in real-time. The DeepFilterNet framework can be obtained under an open source license.
研究动机与目标
- 解决现有基于深度学习的语音增强方法在全频带音频上计算复杂度高、时序缓冲大的问题。
- 实现在资源受限的嵌入式设备(如树莓派 4)上的实时推理。
- 在保持低模型复杂度和低推理延迟的前提下,提升语音增强性能。
- 优化训练流程和数据增强方法,以提升收敛性和鲁棒性,同时显著降低模型尺寸。
- 通过高效、基于感知的信号处理方法扩展 DeepFilterNet 框架,以提升语音质量和可懂度。
提出的方法
- 采用两阶段架构:第一阶段在压缩的 ERB(感知)频率域中使用实值增益增强语音包络。
- 第二阶段在复数谱域中应用深度滤波(DF),以重建高达 5 kHz 的周期性语音分量。
- 使用共享编码器将 ERB 和复数谱特征融合为两阶段的联合嵌入表示。
- 应用多分辨率谱图损失结合时域重建,以提升感知质量和泛化能力。
- 实施迭代训练优化:学习率热身配合余弦衰减、自适应权重衰减,以及从 8 到 96 的批量大小调度。
- 引入后处理滤波器以优化最终增强信号,提升客观和主观指标。

实验结果
研究问题
- RQ1两阶段语音增强框架是否能在保持计算高效的同时,实现在全频带音频上的 SOTA 性能,并适用于实时嵌入式部署?
- RQ2优化的训练流程(如学习率热身、余弦衰减和批量大小调度)如何影响收敛性和模型性能?
- RQ3多分辨率谱图损失在多大程度上提升了语音增强的感知质量和鲁棒性?
- RQ4在极低信噪比环境下,深度滤波是否能在计算开销极小的前提下超越传统复数比掩码?
- RQ5在低功耗硬件(如树莓派 4)上,可实现的实时因子是多少?与先前的 SOTA 方法相比如何?
主要发现
- DeepFilterNet2 在 Voicebank+Demand 测试集上取得 3.08 的 PESQ 分数,超越先前的 SOTA 方法(如 FRCRN 和 GaGNet),且仅使用 2.3M 参数。
- 该模型在 Core-i5 CPU 上将实时因子降低至 0.04,实现在标准笔记本电脑上的高效实时推理。
- 在 DNS4 盲测数据集上,DeepFilterNet2 的 DNSMOS 分数分别为 4.196(SIGMOS)、4.427(BAKMOS)和 3.882(OVLMOS),接近干净参考信号的质量。
- 该模型在树莓派 4 上运行的实时因子为 0.42,证明了其在嵌入式设备部署的可行性。
- 引入后处理滤波器后,MOS 评分略有提升,OVLMOS 达到 3.896,表明整体语音质量得到增强。
- 尽管参数量略有增加(2.306M),但模型保持了低 MACS(0.356G),并通过训练和架构优化显著优于 DeepFilterNet(RTF 0.11 → 0.04)。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。