[论文解读] On the use of DNN Autoencoder for Robust Speaker Recognition
本文提出使用深度神经网络自编码器作为鲁棒文本无关说话人识别的预处理前端,通过训练将含噪和混响语音映射为干净语音。该方法显著提升了性能——相比基线模型相对提升超过70%,尤其在具有挑战性的噪声和混响条件下表现优异,最佳结果来自结合自编码器增强与使用真实房间脉冲响应的多条件PLDA训练。
In this paper, we present an analysis of a DNN-based autoencoder for speech enhancement, dereverberation and denoising. The target application is a robust speaker recognition system. We started with augmenting the Fisher database with artificially noised and reverberated data and we trained the autoencoder to map noisy and reverberated speech to its clean version. We use the autoencoder as a preprocessing step for a state-of-the-art text-independent speaker recognition system. We compare results achieved with pure autoencoder enhancement, multi-condition PLDA training and their simultaneous use. We present a detailed analysis with various conditions of NIST SRE 2010, PRISM and artificially corrupted NIST SRE 2010 telephone condition. We conclude that the proposed preprocessing significantly outperforms the baseline and that this technique can be used to build a robust speaker recognition system for reverberated and noisy data.
研究动机与目标
- 提升在噪声和混响环境中,特别是真实世界电话和劣化音频条件下的说话人识别鲁棒性。
- 探究基于DNN的自编码器作为说话人识别系统信号预处理前端的有效性。
- 比较并结合自编码器语音增强与多条件PLDA训练的优势,以提升系统鲁棒性。
- 评估训练数据质量与类型——尤其是真实与人工生成的房间脉冲响应及噪声类型——对系统性能的影响。
- 确定结合自编码器增强与多条件PLDA训练是否相比单独使用任一技术能获得更优性能。
提出的方法
- 使用三个隐藏层(每层1500个神经元)的深度神经网络自编码器,训练其从含噪和混响输入中重建干净语音。
- 使用Fisher英语语料库作为干净语音数据,通过真实和合成的噪声及房间脉冲响应(RIRs)人工污染,生成训练对。
- 在混合前对噪声和信号应用A计权,以模拟人类听觉感知,并基于VAD检测的语音帧控制信噪比(SNR)。
- 在对数幅度谱图上使用均方误差(MSE)作为损失函数进行自编码器训练,输入包含31帧上下文(3999维输入)。
- 将自编码器输出的增强语音作为最先进的文本无关说话人识别系统(基于i-向量和PLDA)的输入。
- 将自编码器预处理与多条件PLDA训练相结合,使用与自编码器训练中相同的噪声和RIR类型进行数据污染。
实验结果
研究问题
- RQ1基于DNN自编码器的语音增强是否能提升在噪声和混响条件下的说话人识别性能?
- RQ2在说话人识别中,使用真实还是人工生成的房间脉冲响应对自编码器性能有何影响?
- RQ3在不同测试条件下,自编码器增强与多条件PLDA训练在鲁棒性和性能方面如何比较?
- RQ4将自编码器预处理与多条件PLDA训练结合是否能获得优于单独使用任一技术的性能?
- RQ5训练数据的数量与质量对自编码器及整体说话人识别系统有效性有何影响?
主要发现
- N + RR自编码器(在真实RIR和噪声上训练)优于所有其他自编码器变体,尤其在真实世界混响和噪声条件下表现更优。
- 将N + RR自编码器与多条件PLDA训练结合,在最具有挑战性的rev-noise-tel-tel条件下,相比基线系统实现超过70%的相对性能提升。
- 在最困难条件下,多条件PLDA训练略优于纯自编码器增强,但对干净数据的性能退化更严重。
- 两种技术的结合消除了在人工与真实RIR数据上训练的系统之间的性能差距,实现了跨条件的一致鲁棒性。
- 在自编码器训练中使用真实RIR比使用更多人工RIR效果更好,表明在此情境下数据质量优于数量。
- 在所有测试集上,N + RR自编码器与在N + RR数据上训练的多条件PLDA结合,成为最鲁棒且普遍有效的配置。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。