Skip to main content
QUICK REVIEW

[论文解读] Deep neural network techniques for monaural speech enhancement: state of the art analysis

Peter Juma Ochieng|arXiv (Cornell University)|Dec 1, 2022
Speech and Audio Processing被引用 6
一句话总结

本文对单耳语音增强与分离的深度神经网络(DNN)技术进行了全面的前沿分析,涵盖特征提取、局部与全局语音上下文建模、监督与无监督训练、模型压缩、目标函数、领域自适应以及预训练模型。文章识别出关键趋势、挑战与新兴方向,包括动态说话人数量处理和数据高效设计,重点提升真实应用场景中的鲁棒性与效率。

ABSTRACT

Deep neural networks (DNN) techniques have become pervasive in domains such as natural language processing and computer vision. They have achieved great success in these domains in task such as machine translation and image generation. Due to their success, these data driven techniques have been applied in audio domain. More specifically, DNN models have been applied in speech enhancement domain to achieve denosing, dereverberation and multi-speaker separation in monaural speech enhancement. In this paper, we review some dominant DNN techniques being employed to achieve speech separation. The review looks at the whole pipeline of speech enhancement from feature extraction, how DNN based tools are modelling both global and local features of speech and model training (supervised and unsupervised). We also review the use of speech-enhancement pre-trained models to boost speech enhancement process. The review is geared towards covering the dominant trends with regards to DNN application in speech enhancement in speech obtained via a single speaker.

研究动机与目标

  • 分析单耳语音增强与分离全流程中主流DNN技术的应用。
  • 识别在建模长期依赖性、处理未知说话人以及降低计算复杂度方面的关键挑战。
  • 评估预训练模型与无监督学习在提升泛化能力及减少对成对干净-噪声数据依赖性方面的作用。
  • 探索以数据为中心的改进方法,如最优序列长度与目标数据中的早期混响,以提升泛化能力。
  • 突出当前方法中的关键缺口,特别是在无监督多说话人分离与动态说话人数量自适应方面。

提出的方法

  • 回顾频谱域与时域特征,包括对数功率谱、梅尔频率倒谱系数(MFCCs)、DFT幅值以及用于DNN输入的复数特征。
  • 分析RNNs、Transformer与时间卷积网络(TCNs)等DNN架构在建模长期语音依赖性方面的应用。
  • 研究通过谱映射、掩码与生成建模实现的监督训练,重点分析相位重建与损失函数。
  • 调查知识蒸馏、权重重用、量化、剪枝与深度可分离卷积等模型压缩技术。
  • 评估无监督与自监督方法,包括对比学习及基于预训练模型的损失函数。
  • 提出不直接使用预训练模型进行去噪,而是提取其中间特征用于损失计算,从而实现在无成对数据情况下的端到端训练。

实验结果

研究问题

  • RQ1在单耳增强中,哪些DNN架构与特征表示在建模局部与全局语音上下文方面最为有效?
  • RQ2无监督与自监督方法在说话人分离与混响抑制任务中与监督方法相比表现如何?
  • RQ3当前基于DNN的语音增强工具在推理阶段面对可变数量说话人时存在哪些关键局限性?
  • RQ4如何通过微调预训练模型在无需成对干净-噪声数据的前提下提升语音增强性能?
  • RQ5哪些数据层面的改进(如目标数据中的早期混响)可增强模型泛化能力并降低计算开销?

主要发现

  • 在语音增强数据上微调的预训练模型可达到最先进性能,并对未见噪声类型具有良好的泛化能力。
  • 利用预训练模型多个层的特征作为监督信号,可在不训练专用去噪网络的前提下提升去噪性能。
  • 知识蒸馏与量化等模型压缩技术显著降低推理延迟与模型大小,同时保持增强质量。
  • 当前工具在推理时若说话人数量与训练阶段假设不一致,常出现维度不匹配,导致效率低下或输出质量下降。
  • 在训练中引入目标语音的早期混响可提升增强语音的感知质量,提示需要标准化包含此类目标的基准数据集。
  • 尽管去噪技术已取得进展,但无监督DNN方法在多说话人分离与混响抑制方面仍存在关键缺口。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。