[论文解读] Triplet Based Embedding Distance and Similarity Learning for Text-independent Speaker Verification
本文提出了一种基于三元组的训练框架,用于文本无关说话人验证,该框架联合优化三元组距离损失与嵌入相似性度量网络,并结合标准的softmax损失。通过引入双分支DNN来分类说话人相似性并优化嵌入距离,该方法在NIST SRE16测试集上实现了等错误率(EER)和检测成本函数(DCF)9%的相对降低,优于基线x-vector系统。
Speaker embeddings become growing popular in the text-independent speaker verification task. In this paper, we propose two improvements during the training stage. The improvements are both based on triplet cause the training stage and the evaluation stage of the baseline x-vector system focus on different aims. Firstly, we introduce triplet loss for optimizing the Euclidean distances between embeddings while minimizing the multi-class cross entropy loss. Secondly, we design an embedding similarity measurement network for controlling the similarity between the two selected embeddings. We further jointly train the two new methods with the original network and achieve state-of-the-art. The multi-task training synergies are shown with a 9% reduction equal error rate (EER) and detected cost function (DCF) on the 2016 NIST Speaker Recognition Evaluation (SRE) Test Set.
研究动机与目标
- 通过解决x-vector系统中训练目标与评估目标之间的不一致性,提升文本无关说话人验证的性能。
- 通过基于三元组的优化,减少说话人内部的嵌入方差,并增强说话人之间的分离度。
- 通过引入可学习的相似性度量网络,提升评分的鲁棒性,以对语音段嵌入进行相似性建模。
- 联合训练多种损失函数(softmax、三元组距离和相似性),以实现协同增益。
提出的方法
- 引入一种三元组损失,通过最小化锚点与正样本嵌入之间的欧氏距离,同时最大化与负样本的距离,直接优化验证性能。
- 设计一个辅助DNN——嵌入相似性度量网络,将拼接后的锚点与正/负样本嵌入作为输入,预测其说话人相似性。
- 联合训练x-vector主干网络,使用三种损失函数:多分类交叉熵(softmax)、三元组距离损失和相似性分类损失,采用可学习的权重系数β和γ。
- 通过MUSAN和RIRs进行数据增强,以提升训练集的多样性与鲁棒性。
- 使用t-SNE可视化分析嵌入聚类情况,通过DET曲线分析不同系统间的得分分布。
- 采用Kaldi的PLDA后端进行评分,并在NIST SRE16测试集上使用EER和DCF16指标进行评估。
实验结果
研究问题
- RQ1基于三元组的距离优化能否减少文本无关说话人验证中说话人内部的方差,并降低EER?
- RQ2可学习的相似性度量网络能否通过更精确地建模嵌入间相似性,从而改善DCF表现?
- RQ3联合训练多种损失函数(softmax、三元组距离和相似性)是否能产生协同增益,优于单损失或双损失训练?
- RQ4不同嵌入层(A与B)及归一化技术对所提方法性能有何影响?
主要发现
- 联合训练softmax、三元组距离和相似性损失的系统(System 5)在SRE16测试集上实现了等错误率(EER)和检测成本函数(DCF)9%的相对降低。
- 仅使用嵌入相似性度量网络的系统(System 3)使DCF降低了10.5%,同时EER略有上升,表明后端评分性能得到显著提升。
- 仅使用三元组距离训练的系统(System 4)实现了最大的EER降低(12.5%相对),证明了说话人内部紧凑性的提升。
- 联合使用三元组距离和相似性网络的训练(System 5)优于单一组件,显示出互补优势,并可通过超参数调优(β和γ)实现性能权衡。
- 相似性网络的非目标得分分布比基线系统更靠负,证实了其更强的判别能力。
- L2归一化未提升性能(System 7),使用嵌入B代替嵌入A的性能更差(System 8),表明嵌入A更适合所提模块。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。