[论文解读] DNN based Speaker Recognition on Short Utterances
本文提出了一种基于DNN-senone的高斯概率线性判别分析(GPLDA)系统,用于短语音条件下的说话人验证,用DNN替代传统GMM-UBM以提升语音感知能力的说话人建模效果。该系统在短语音条件下的EER相比GMM-UBM GPLDA系统实现了超过50%的相对提升,尤其在GPLDA模型使用30秒开发数据进行训练时,对说话人、会话和语音变异性表现出更强的鲁棒性。
This paper investigates the effects of limited speech data in the context of speaker verification using deep neural network (DNN) approach. Being able to reduce the length of required speech data is important to the development of speaker verification system in real world applications. The experimental studies have found that DNN-senone-based Gaussian probabilistic linear discriminant analysis (GPLDA) system respectively achieves above 50% and 18% improvements in EER values over GMM-UBM GPLDA system on NIST 2010 coreext-coreext and truncated 15sec-15sec evaluation conditions. Further when GPLDA model is trained on short-length utterances (30sec) rather than full-length utterances (2min), DNN-senone GPLDA system achieves above 7% improvement in EER values on truncated 15sec-15sec condition. This is because short length development i-vectors have speaker, session and phonetic variation and GPLDA is able to robustly model those variations. For several real world applications, longer utterances (2min) can be used for enrollment and shorter utterances (15sec) are required for verification, and in those conditions, DNN-senone GPLDA system achieves above 26% improvement in EER values over GMM-UBM GPLDA systems.
研究动机与目标
- 研究在语音数据有限条件下,特别是短语音条件下,基于DNN-senone的GPLDA系统在说话人验证中的性能表现。
- 评估在短语音(30秒)上训练GPLDA背景模型是否相比在完整时长(2分钟)数据上训练,能提升对说话人、会话和语音变异性因素的鲁棒性。
- 在实际场景中对比DNN-senone GPLDA系统与传统GMM-UBM GPLDA系统的表现,其中注册使用长语音(2分钟),验证使用短语音(15秒)。
- 确定DNN声学建模在低资源、短语音设置下对性能提升的贡献程度。
- 评估DNN提供的语音感知对齐信息对i-vector提取及后续PLDA评分在短时长验证任务中的影响。
提出的方法
- 用DNN替代GMM-UBM以计算senone后验概率,并利用Baum-Welch算法计算i-vector提取所需的充分统计量。
- 基于DNN-senone后验概率统计量,通过总体可变性建模提取600维i-vector。
- 在使用PLDA模型进行评分前,对i-vector实施长度归一化和均值减除处理。
- 将GPLDA背景模型在完整时长(2分钟)或短时长(30秒)开发语音上进行训练,以评估训练数据长度的影响。
- 采用批量似然比评分方法,利用域内NIST数据估计类内(WC)和类间(AC)协方差矩阵。
- 使用Kaldi工具包实现i-vector提取、PLDA评分及在NIST 2010数据集上的评估。
实验结果
研究问题
- RQ1当注册和验证语音均为短语音(15秒)时,基于DNN-senone的GPLDA系统是否优于GMM-UBM GPLDA系统?
- RQ2在短语音(30秒)上训练GPLDA背景模型,是否相比在完整时长(2分钟)语音上训练,能提升短语音验证任务的性能?
- RQ3在实际场景中(注册使用2分钟长语音,验证使用15秒短语音),DNN-senone方法表现如何?
- RQ4尽管具备语音感知能力,为何DNN-senone系统在极短语音(10秒)上的性能提升幅度低于较长语音?
- RQ5在短时长开发数据中包含语音、会话和说话人变异性信息,对GPLDA建模能力的增强程度如何?
主要发现
- 在NIST 2010 coreext-coreext条件下的短语音设置中,基于DNN-senone的GPLDA系统相比GMM-UBM GPLDA系统实现了超过50%的EER相对降低。
- 在截短的15秒-15秒评估条件下,DNN-senone GPLDA系统相比GMM-UBM GPLDA系统实现了18%的EER相对降低,表明存在中等但稳定的性能增益。
- 当GPLDA模型改用30秒开发语音而非2分钟语音进行训练时,DNN-senone GPLDA系统在15秒-15秒条件下的EER实现了超过7%的绝对降低。
- 在真实场景中(2分钟注册,15秒验证),DNN-senone GPLDA系统相比GMM-UBM GPLDA系统实现了超过26%的EER相对降低。
- 短时长训练数据带来的性能提升,归因于对短i-vector中说话人、会话和语音变异性建模的改进。
- 当注册语音为长语音时,短时长数据训练无法提升性能,因为长语音仅包含说话人和会话变异性,不包含语音变异性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。