Skip to main content
QUICK REVIEW

[论文解读] Recursive speech separation for unknown number of speakers

Naoya Takahashi, Parthasaarathy Sudarsanam|arXiv (Cornell University)|Apr 5, 2019
Speech and Audio Processing参考文献 20被引用 6
一句话总结

本文提出一种基于单次余数排列不变训练(OR-PIT)的递归语音分离方法,利用单一模型从单通道混合信号中分离出未知数量的说话人。通过迭代地逐个分离出一个说话人,并将残差信号重新输入模型,该方法在2人和3人混合语音分离任务中达到最先进性能,并且无需微调即可泛化至未见过的4人混合语音。

ABSTRACT

In this paper we propose a method of single-channel speaker-independent multi-speaker speech separation for an unknown number of speakers. As opposed to previous works, in which the number of speakers is assumed to be known in advance and speech separation models are specific for the number of speakers, our proposed method can be applied to cases with different numbers of speakers using a single model by recursively separating a speaker. To make the separation model recursively applicable, we propose one-and-rest permutation invariant training (OR-PIT). Evaluation on WSJ0-2mix and WSJ0-3mix datasets show that our proposed method achieves state-of-the-art results for two- and three-speaker mixtures with a single model. Moreover, the same model can separate four-speaker mixture, which was never seen during the training. We further propose the detection of the number of speakers in a mixture during recursive separation and show that this approach can more accurately estimate the number of speakers than detection in advance by using a deep neural network based classifier.

研究动机与目标

  • 解决当说话人数量未知或变化时,单通道多说话人语音分离的挑战。
  • 开发一种统一的深度学习模型,能够泛化于不同数量的说话人,包括训练时未见过的更多说话人情况。
  • 设计一种递归分离框架,逐个分离说话人,以提升鲁棒性与可扩展性。
  • 提出一种可靠的迭代终止机制,实现在推理过程中动态检测说话人数量。
  • 在未预先知晓说话人数量的情况下,实现对嘈杂多说话人环境中最显著说话人的高质量分离。

提出的方法

  • 提出一种新颖的训练目标——单次余数排列不变训练(OR-PIT),使模型能够以排列不变的方式从其余说话人中分离出一个说话人,支持递归应用。
  • 递归应用训练好的模型:首先分离出一个说话人,然后将残差信号反馈回模型进行下一轮迭代。
  • 使用基于AlexNet的二分类器检测残差信号中是否包含语音或噪声,作为递归的停止条件。
  • 在第二个输出通道的残差信号上训练二分类器,以检测是否已无更多说话人,从而实现自动终止。
  • 利用递归结构优先分离最显著的说话人,从而提升关键说话人的整体分离质量。
  • 在所有递归步骤中使用共享的模型架构(Conv-TasNet-gLN),确保参数效率与泛化能力。

实验结果

研究问题

  • RQ1单一深度学习模型是否能泛化于不同数量说话人的语音分离任务,包括训练时未见过的数量?
  • RQ2如何有效训练一种递归分离框架,以在多轮迭代中保持高性能?
  • RQ3能否开发一种可靠、数据驱动的停止条件,以在无先验知识的情况下检测说话人数量?
  • RQ4递归分离方法是否优于假设固定说话人数量的端到端模型?
  • RQ5当未在该类数据上进行训练时,模型是否能成功从大量说话人混合(如10–50人)中分离出主导说话人?

主要发现

  • 所提出的基于OR-PIT的递归方法在WSJ0-2mix和WSJ0-3mix数据集上使用单一模型即达到最先进性能。
  • 该模型可泛化至训练中未见过的4人混合语音,经过三次递归迭代后仍取得出人意料的高质量分离结果。
  • 用于迭代终止的二分类器在残差信号中检测语音/噪声的准确率达到95.7%,优于多分类说话人计数分类器(准确率77.9%)。
  • 该方法在包含多达50名干扰说话人的混合语音中,仍能持续提升主导说话人的SI-SNR,且未在该类数据上进行微调。
  • 递归方法自然优先分离最显著说话人,第一轮迭代即实现最高质量的分离,后续说话人质量逐步下降。
  • 该模型在无需架构或训练修改的情况下处理未知说话人数量,展现出强大的泛化能力与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。