Skip to main content
QUICK REVIEW

[论文解读] Target Speaker Extraction for Overlapped Multi-Talker Speaker Verification

Wei Rao, Chenglin Xu|arXiv (Cornell University)|Feb 7, 2019
Speech Recognition and Synthesis参考文献 15被引用 4
一句话总结

本文提出了一种用于重叠多说话人语音验证的目标说话人提取框架,通过目标说话人提取模块从混合语音中分离出目标说话人的语音,再将其输入i-vector/PLDA语音验证系统。该方法实现了65.7%的相对EER降低,其中SBF-MTSAL-Concat优于SBF-MTSAL。

ABSTRACT

The performance of speaker verification degrades significantly when the test speech is corrupted by interference speakers. Speaker diarization does well to separate speakers if the speakers are temporally overlapped. However, if multi-talkers speak at the same time, we need the technique to separate the speech in the spectral domain. This paper proposes an overlapped multi-talker speaker verification framework by using target speaker extraction methods. Specifically, given the target speaker information, the target speaker's speech is firstly extracted from the overlapped multi-talker speech by a target speaker extraction module. Then, the extracted speech is passed to the speaker verification system. Experimental results show that the proposed approach significantly improves the performance of overlapped multi-talker speaker verification and achieves 65.7% relative EER reduction.

研究动机与目标

  • 解决多个说话人同时说话时语音验证性能下降的问题。
  • 克服现有语音分离方法需要预先知道说话人数量的局限性。
  • 通过目标说话人提取提升在完全重叠多说话人场景下的语音验证鲁棒性。
  • 比较两种目标说话人提取网络——SBF-MTSAL与SBF-MTSAL-Concat——在重叠多说话人场景下的有效性。
  • 通过结合干净语音与提取语音进行训练,减轻语音验证中提取语音与干净语音之间的不匹配问题。

提出的方法

  • 该框架使用一个目标说话人提取模块,利用注册语音作为辅助信息,从混合语音中分离出目标说话人的语音。
  • 目标说话人提取网络采用幅度谱和时序谱近似损失,以估计相位敏感的掩码,从而提升语音重建质量。
  • SBF-MTSAL通过一个辅助网络生成自适应权重,在基于CADNN的架构中优化掩码估计。
  • SBF-MTSAL-Concat通过在掩码估计前将辅助特征与混合特征拼接,增强了表征学习能力。
  • 提取后的语音随后由标准的i-vector/PLDA语音验证系统进行处理以完成验证。
  • 通过合并开发数据中的提取语音,构建联合训练集(干净+ext),以减少提取语音与干净语音之间的不匹配。

实验结果

研究问题

  • RQ1目标说话人提取是否能显著提升完全重叠多说话人场景下的语音验证性能?
  • RQ2在重叠多说话人语音验证中,SBF-MTSAL与SBF-MTSAL-Concat的性能表现如何比较?
  • RQ3在训练中结合干净语音与提取语音,在多大程度上能减轻语音验证中提取语音与干净语音之间的不匹配?
  • RQ4当测试语音完全被多个说话人重叠时,所提出的框架是否仍保持鲁棒性?
  • RQ5在此设置下,目标说话人提取的性能上限是多少?所提方法与之接近程度如何?

主要发现

  • 所提出的目标准确提取框架在完全重叠测试数据上相比基线系统实现了65.7%的相对EER降低。
  • SBF-MTSAL-Concat优于SBF-MTSAL,在重叠多说话人语音验证中表现出更低的EER与DCF性能。
  • 使用联合干净+ext训练集可提升SBF-MTSAL-Concat在混合测试集上的性能,表明有效缓解了不匹配问题。
  • 干净+ext训练集虽提升了干净测试集上的EER表现,但导致DCF性能下降,表明存在泛化权衡。
  • 基线系统在完全重叠测试数据上表现出显著的性能下降,凸显了多说话人干扰的挑战。
  • 理想提取的上限性能表明,所提方法已接近最优,显示出在实际部署中的强大潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。