[论文解读] Speech Enhancement using Self-Adaptation and Multi-Head Self-Attention
本文提出了一种自适应语音增强方法,通过语音增强与说话人识别的多任务学习,直接从测试语音中提取说话人感知特征。通过使用多头自注意力机制建模长期依赖关系,并将说话人识别分支的最终隐藏层作为辅助特征,该模型在公开数据集上实现了最先进性能,在客观和主观质量方面均优于传统方法,即使对于未见过的说话人亦表现优异。
This paper investigates a self-adaptation method for speech enhancement using auxiliary speaker-aware features; we extract a speaker representation used for adaptation directly from the test utterance. Conventional studies of deep neural network (DNN)--based speech enhancement mainly focus on building a speaker independent model. Meanwhile, in speech applications including speech recognition and synthesis, it is known that model adaptation to the target speaker improves the accuracy. Our research question is whether a DNN for speech enhancement can be adopted to unknown speakers without any auxiliary guidance signal in test-phase. To achieve this, we adopt multi-task learning of speech enhancement and speaker identification, and use the output of the final hidden layer of speaker identification branch as an auxiliary feature. In addition, we use multi-head self-attention for capturing long-term dependencies in the speech and noise. Experimental results on a public dataset show that our strategy achieves the state-of-the-art performance and also outperform conventional methods in terms of subjective quality.
研究动机与目标
- 探究基于深度神经网络(DNN)的语音增强模型是否能在推理阶段无辅助引导信号的情况下适应未知说话人。
- 通过直接从测试语音中提取说话人感知特征,提升泛化能力与性能。
- 利用多头自注意力机制增强语音与噪声中长期时间依赖关系的建模。
- 通过语音增强与说话人识别的联合多任务学习,实现语音增强的最先进性能。
提出的方法
- 采用多任务学习框架,通过共享编码器联合训练用于语音增强和说话人识别的DNN。
- 将说话人识别分支的最终隐藏层输出作为语音增强的辅助特征。
- 将多头自注意力(MHSA)与双向LSTM结合,用于建模时序表示中的长程时间依赖关系。
- 通过一个DNN估计T-F掩码,其输入为含噪输入的STFT和说话人感知特征。
- 采用CNN、BLSTM与MHSA相结合的混合架构,实现鲁棒的特征提取与时间建模。
- 通过在掩码后的STFT谱图上应用逆STFT,重建最终的增强语音信号。
实验结果
研究问题
- RQ1基于DNN的语音增强模型是否能在推理阶段无任何辅助引导信号的情况下,有效适应未知说话人?
- RQ2直接从测试语音中提取的说话人感知特征是否能提升语音增强性能?
- RQ3多头自注意力机制的引入是否增强了对含噪语音中长期依赖关系的建模能力?
- RQ4语音增强与说话人识别的联合多任务学习是否能带来更好的泛化能力与性能?
主要发现
- 所提方法在公开语音增强数据集上实现了最先进性能,客观指标优于现有方法。
- 基于ITU-T P.835的主观评估显示,所提方法在所有指标(S-MOS、N-MOS和G-MOS)上均获得最高平均意见得分(MOS)。
- 配对单侧t检验表明,与SEGAN和DFL等基线模型相比,所有主观质量指标均具有统计显著性提升(p < 0.01)。
- 说话人识别分支成功提取了说话人感知表征,64%和84%的时间帧与不同说话人相关联,表明实现了动态说话人选择。
- 将说话人识别分支的最终隐藏层作为辅助特征,显著提升了PESQ与COVL得分,相较无说话人引导的模型表现更优。
- 该模型对未见说话人具有良好的泛化能力,即使目标说话人未出现在训练数据中,仍表现出强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。