Skip to main content
QUICK REVIEW

[论文解读] Continuous Speech Separation Using Speaker Inventory for Long Multi-talker Recording

Cong Han, Yi Luo|arXiv (Cornell University)|Dec 17, 2020
Speech and Audio Processing参考文献 33被引用 6
一句话总结

本文提出连续语音分离使用说话人清单(CSSUSI)方法,该方法通过基于聚类的说话人嵌入提取,直接从长时多说话人录音中构建说话人清单,无需外部注册数据。该方法在长时、真实、噪声大且混响强的录音中显著优于基线模型,甚至超越了使用外部说话人信息的系统。

ABSTRACT

Leveraging additional speaker information to facilitate speech separation has received increasing attention in recent years. Recent research includes extracting target speech by using the target speaker's voice snippet and jointly separating all participating speakers by using a pool of additional speaker signals, which is known as speech separation using speaker inventory (SSUSI). However, all these systems ideally assume that the pre-enrolled speaker signals are available and are only evaluated on simple data configurations. In realistic multi-talker conversations, the speech signal contains a large proportion of non-overlapped regions, where we can derive robust speaker embedding of individual talkers. In this work, we adopt the SSUSI model in long recordings and propose a self-informed, clustering-based inventory forming scheme for long recording, where the speaker inventory is fully built from the input signal without the need for external speaker signals. Experiment results on simulated noisy reverberant long recording datasets show that the proposed method can significantly improve the separation performance across various conditions.

研究动机与目标

  • 解决现有语音分离系统在长时真实录音中需要预先注册说话人信号的不切实际问题。
  • 提升在整体重叠度低、说话人活动稀疏的长录音中连续语音分离(CSS)的性能。
  • 开发一种自学习、基于聚类的方法,直接从输入混合信号中构建说话人清单。
  • 证明从长录音中非重叠区域提取的说话人信息可显著提升分离性能。

提出的方法

  • 使用预训练的说话人嵌入模型从长录音的非重叠段中提取说话人嵌入。
  • 对提取的嵌入应用过聚类,形成自学习的说话人清单,其中聚类数超过预期的说话人数。
  • 使用配置选择模块,根据与混合信号嵌入的相似度,从清单中动态选择相关说话人配置。
  • 将选定的配置输入偏置语音分离模块,该模块采用排列不变训练(PIT)以提高鲁棒性,并处理弱匹配或错误匹配的情况。
  • 将局部分离输出拼接为每个说话人的连续、非重叠语音流。
  • 在模拟的噪声大、混响强的长录音数据集上进行系统训练与评估,该数据集模拟自然的会议室对话场景。

实验结果

研究问题

  • RQ1在长时多说话人录音中,能否在无需外部注册数据的情况下,仅从混合信号本身有效构建说话人清单?
  • RQ2使用自学习清单的语音分离性能与依赖预注册说话人信号的系统相比如何?
  • RQ3过聚类对长录音中说话人配置选择的鲁棒性与准确性有何影响?
  • RQ4从长录音中非重叠区域提取的说话人嵌入,在连续、低重叠场景下能多大程度上提升分离性能?
  • RQ5在真实条件下,该方法在不同说话人数和重叠率下是否能保持高性能?

主要发现

  • CSSUSI 在所有配置下均显著优于基线 BLSTM 模型,在 2 说话人、5 说话人和 8 说话人录音中分别达到 13.1 dB、11.9 dB 和 11.7 dB 的 SI-SDR。
  • CSSUSI 在性能上与使用外部注册数据的 SSUSI 相当(分别为 13.2 dB、12.0 dB、11.7 dB),同时消除了对外部说话人数据的需求。
  • 系统在不同聚类数下保持一致的性能,表明当聚类数不少于说话人数时,对过聚类具有鲁棒性。
  • 性能提升主要源于对相关说话人配置的有效利用,因为使用两个错误配置的 SSUSI 仅略优于基线。
  • 话语级评估证实,CSSUSI 显著优于基线,展现出在长时分离任务中强大的泛化能力与连续性。
  • 该方法成功利用非重叠区域的全局说话人信息来改善局部分离,证明在真实、噪声大且混响强的环境中具有有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。