[论文解读] Speech Enhancement using a Deep Mixture of Experts
本文提出了一种用于单麦克风语音增强的深度专家混合(DMoE)框架,通过为不同语音类型(尤其是有声与无声音素)训练专用的深度神经网络(DNN)专家,同时使用门控网络动态分配输入帧,从而提升对未见噪声的鲁棒性。该方法通过端到端联合训练专家与门控网络,无需使用音素标注数据,结合无监督聚类和对SPP(语音存在概率)的软注意力机制,实现了对频谱衰减的优化,其性能优于全连接DNN和先前的MoE方法。
In this study we present a Deep Mixture of Experts (DMoE) neural-network architecture for single microphone speech enhancement. By contrast to most speech enhancement algorithms that overlook the speech variability mainly caused by phoneme structure, our framework comprises a set of deep neural networks (DNNs), each one of which is an 'expert' in enhancing a given speech type corresponding to a phoneme. A gating DNN determines which expert is assigned to a given speech segment. A speech presence probability (SPP) is then obtained as a weighted average of the expert SPP decisions, with the weights determined by the gating DNN. A soft spectral attenuation, based on the SPP, is then applied to enhance the noisy speech signal. The experts and the gating components of the DMoE network are trained jointly. As part of the training, speech clustering into different subsets is performed in an unsupervised manner. Therefore, unlike previous methods, a phoneme-labeled database is not required for the training procedure. A series of experiments with different noise types verified the applicability of the new algorithm to the task of speech enhancement. The proposed scheme outperforms other schemes that either do not consider phoneme structure or use a simpler training methodology.
研究动机与目标
- 解决在非平稳且未见过的噪声环境中语音增强的挑战,因为传统DNN会因输入可变性导致性能下降。
- 克服全连接DNN在语音可变性及训练与测试条件不匹配方面存在的局限性。
- 通过在训练过程中对语音进行无监督聚类,将语音划分为专家特定类型,从而消除对音素标注数据集的需求。
- 通过基于语音音素结构(有声/无声)的专家专业化,提升语音存在概率(SPP)估计与频谱衰减质量。
- 采用可微分框架联合训练门控网络与专家,避免依赖外部自动语音识别系统或预标注音素。
提出的方法
- 该框架采用多个DNN专家的混合结构,每个专家专门负责增强特定语音类型(如有声或无声音素),通过无监督聚类语音特征学习得到。
- 一个独立的门控DNN接收噪声输入的MFCC特征,并输出软注意力权重,将每个输入帧分配给最相关的专家。
- 最终的SPP通过专家预测的加权平均计算得出,权重由门控网络的输出决定。
- 使用基于SPP的软掩码实施频谱衰减,实现平滑增强,避免产生音乐噪声。
- 整个DMoE架构(包括专家与门控网络)通过可微分损失函数进行端到端训练,无需音素标签。
- 训练过程包含无监督语音聚类,用于定义专家特定的语音类型,使模型能在无先验语言监督的情况下学习结构。
实验结果
研究问题
- RQ1通过利用语音内在可变性,专家混合架构是否能提升在未见噪声环境下的语音增强鲁棒性?
- RQ2将语音段无监督聚类为专家特定类型(如有声与无声)是否能带来优于全连接DNN的泛化能力?
- RQ3能否通过端到端训练的门控网络在无音素级监督的情况下,学会将语音帧路由到合适的专家?
- RQ4基于语音音素结构(有声/无声)的专家专业化如何影响SPP估计与频谱衰减质量?
- RQ5DMoE框架在客观与主观指标上,相较于现有DNN与MoE方法,在多大程度上实现了性能超越?
主要发现
- DMoE模型在多种噪声类型下,于客观(PESQ)与主观语音质量指标上,均优于全连接DNN与先前的MoE方法。
- 在TIMIT数据集的嘈杂背景噪声下,使用30个专家的DMoE模型PESQ得分为2.85,显著优于单专家基线与其他SOTA方法。
- 门控网络在无音素标签的情况下,仍能学会将有声帧路由至一个专家,将无声帧路由至另一个专家,表明其具备有效的无监督结构发现能力。
- 由于专家专业化,DMoE模型的SPP估计更加准确且鲁棒,尤其在非平稳噪声(如工厂噪声)下表现更优。
- 即使在测试时遇到训练期间未见过的新颖噪声类型,模型仍保持高性能,表明其具备强大的泛化能力。
- 消融实验表明,当专家接收非信息性输入(即无MFCC)时,只要门控网络激活,仍能生成有意义的SPP估计,证实了门控网络在结构化路由中的关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。