[论文解读] Speaker Embedding Extraction with Phonetic Information
该论文通过在帧级和段级上联合优化与多任务学习,将语音信息整合到x-vector说话人嵌入提取中。该方法在Fisher数据集上将EER降低了20%,minDCF08和minDCF10分别降低了15%,在NIST SRE10上也取得了稳定提升,即使使用域外ASR数据也是如此。
Speaker embeddings achieve promising results on many speaker verification tasks. Phonetic information, as an important component of speech, is rarely considered in the extraction of speaker embeddings. In this paper, we introduce phonetic information to the speaker embedding extraction based on the x-vector architecture. Two methods using phonetic vectors and multi-task learning are proposed. On the Fisher dataset, our best system outperforms the original x-vector approach by 20% in EER, and by 15%, 15% in minDCF08 and minDCF10, respectively. Experiments conducted on NIST SRE10 further demonstrate the effectiveness of the proposed methods.
研究动机与目标
- 解决现有说话人嵌入方法中缺乏对语音信息利用的问题,这些方法通常仅依赖说话人标签。
- 通过在训练期间引入语音内容作为辅助信息,提升说话人嵌入的鲁棒性和判别能力。
- 克服先前两阶段语音向量提取和帧级多任务学习的局限性,实现联合优化与段级监督。
- 通过在帧级和段级上同时运行的多任务学习框架中的共享隐藏层,提升泛化能力并减少过拟合。
提出的方法
- 提出一种联合训练框架,通过共享的深度神经网络(DNN)架构,同时优化说话人嵌入和语音向量提取。
- 引入一种在帧级和段级同时进行分类的多任务学习设置:在帧级预测说话人和语音标签,而在段级预测说话人身份。
- 为说话人和语音网络使用相同的输入特征,共享一定深度的隐藏层,之后接各自的任务特定输出头。
- 对帧级激活值应用统计池化(均值和标准差),生成固定长度的段级嵌入,用于说话人验证。
- 在使用域外语音数据(如Switchboard-I用于NIST SRE10)时,对ASR组件进行微调,以使语音表征与目标域对齐。
- 在LDA和PLDA评分后,使用标准的说话人验证指标——EER、minDCF08、minDCF10进行评估。
实验结果
研究问题
- RQ1在x-vector训练中整合语音信息是否能超越仅使用说话人标签训练的性能?
- RQ2联合优化说话人和语音网络是否能比两阶段训练获得更优的语音向量和更具判别性的说话人嵌入?
- RQ3与仅帧级的多任务学习相比,同时在帧级和段级运行的多任务学习如何影响模型的泛化能力和鲁棒性?
- RQ4当目标数据集(如NIST SRE10)与源数据集(如Switchboard-I)不匹配时,来自域外ASR数据的语音信息是否仍能提升说话人验证性能?
- RQ5在语音监督下的说话人嵌入提取中,多任务学习的最优共享层数是多少?
主要发现
- 在Fisher数据集上,使用微调语音向量的所提方法相比原始x-vector将EER降低了20%。
- 同一系统在minDCF08和minDCF10上均提升了15%,表明在多个评估指标上表现一致。
- 在Fisher数据集上,使用3层共享层的多任务学习达到最佳性能,EER降低20%,minDCF08降低18%。
- 在NIST SRE10 core-extended上,使用微调语音向量的方法相比x-vector将EER降低13%,minDCF08降低8%。
- 在NIST SRE10 core-extended上,使用3层共享层的多任务学习方法将EER降低29%,minDCF08降低18%,即使在语音数据不匹配的情况下也表现出强鲁棒性。
- 在NIST SRE10的10s-10s条件下,使用2层共享层的多任务学习方法达到最低EER,而微调语音向量方法在minDCF08上表现最佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。