Skip to main content
QUICK REVIEW

[论文解读] Single-Channel Speech Separation with Auxiliary Speaker Embeddings

Shuo Liu, Gil Keren|arXiv (Cornell University)|Jun 24, 2019
Speech and Audio Processing参考文献 23被引用 4
一句话总结

本文提出了一种单通道语音分离模型,通过利用每个说话人干净语境录音中提取的辅助说话人嵌入,提升了性能。通过将分离网络基于这些嵌入进行条件化,模型能更准确地将时频单元分配给正确的说话人,在具有挑战性的VoxCeleb数据集上实现了4.79 dB的SDR、8.44 dB的SAR和7.11 dB的SIR,优于深度聚类和DaNet等最先进基线方法。

ABSTRACT

We present a novel source separation model to decompose asingle-channel speech signal into two speech segments belonging to two different speakers. The proposed model is a neural network based on residual blocks, and uses learnt speaker embeddings created from additional clean context recordings of the two speakers as input to assist in attributing the different time-frequency bins to the two speakers. In experiments, we show that the proposed model yields good performance in the source separation task, and outperforms the state-of-the-art baselines. Specifically, separating speech from the challenging VoxCeleb dataset, the proposed model yields 4.79dB signal-to-distortion ratio, 8.44dB signal-to-artifacts ratio and 7.11dB signal-to-interference ratio.

研究动机与目标

  • 解决当说话人具有相似声学特征时单通道语音分离的挑战。
  • 通过基于干净语境录音提取的说话人嵌入来条件化模型,提升语音源分离性能。
  • 通过提供显式的说话人特异性参考嵌入,减少嵌入空间聚类中的歧义。
  • 在每个说话人均有可用干净语音片段的真实世界设置中,提升分离质量。
  • 在大规模、自然语音数据集上超越现有的深度聚类和深度吸引子网络基线方法。

提出的方法

  • 模型对分离网络和说话人嵌入子网络均使用残差块堆叠结构。
  • 独立的说话人嵌入子网络处理每个说话人的干净语境录音,生成说话人特异性嵌入。
  • 主分离网络处理混合语音段,并基于两个说话人嵌入进行条件化,以引导时频单元的归属分配。
  • 网络输出一个估计的干扰帧,其与中心帧的差值即为估计的目标帧。
  • 模型通过最小化目标信号的重建损失进行训练,其中嵌入作为条件输入以提升分离精度。
  • 在推理阶段,模型使用相同的说话人嵌入对分离过程进行条件化,从而在未见说话人上实现鲁棒性能。

实验结果

研究问题

  • RQ1来自干净语境录音的辅助说话人嵌入是否能提升单通道语音分离性能?
  • RQ2将分离网络基于说话人嵌入进行条件化,如何减少时频单元归属中的歧义?
  • RQ3所提方法是否在自然且多样的语音数据上超越深度聚类和深度吸引子网络?
  • RQ4当说话人具有相似声学特征时,说话人嵌入在多大程度上提升了分离质量?
  • RQ5仅使用短时干净语境录音,模型能否泛化到未见过的说话人?

主要发现

  • 所提模型实现了4.79 dB的信噪比(SDR),显著优于深度聚类基线(0.84 dB)和DaNet(1.81 dB)。
  • 模型达到8.44 dB的信噪比-伪影比(SAR),表明其语音质量更优,算法失真更少,优于基线方法。
  • 在7.11 dB的信噪比-干扰比(SIR)下,模型有效抑制了干扰,尽管DaNet达到了更高的SIR(10.41 dB),表明在目标保留方面存在权衡。
  • 性能提升归因于使用了辅助说话人嵌入,这些嵌入为嵌入空间聚类提供了显式参考点。
  • 模型在大规模VoxCeleb数据集上对未见说话人表现出强大的泛化能力,表明其在真实世界设置中的鲁棒性。
  • 可视化结果证实,该模型成功分离了目标说话人和干扰说话人,同时保持了语音可懂性并减少了伪影。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。