Skip to main content
QUICK REVIEW

[论文解读] Improved Source Counting and Separation for Monaural Mixture

Yiming Xiao, Haijian Zhang|arXiv (Cornell University)|Apr 1, 2020
Speech and Audio Processing参考文献 34被引用 6
一句话总结

本文提出了一种新颖的单模型方法用于单耳语音分离,通过注意力机制与深度吸引子网络结合的时间-频率特征融合网络,联合估计未知数量的说话人并分离出各个源信号。该方法在无需事先知晓说话人数量的前提下,对双人与三人混合语音实现了96.7%的说话人计数准确率,并在SI-SNRi和SDRi指标上达到当前最优性能。

ABSTRACT

Single-channel speech separation in time domain and frequency domain has been widely studied for voice-driven applications over the past few years. Most of previous works assume known number of speakers in advance, however, which is not easily accessible through monaural mixture in practice. In this paper, we propose a novel model of single-channel multi-speaker separation by jointly learning the time-frequency feature and the unknown number of speakers. Specifically, our model integrates the time-domain convolution encoded feature map and the frequency-domain spectrogram by attention mechanism, and the integrated features are projected into high-dimensional embedding vectors which are then clustered with deep attractor network to modify the encoded feature. Meanwhile, the number of speakers is counted by computing the Gerschgorin disks of the embedding vectors which are orthogonal for different speakers. Finally, the modified encoded feature is inverted to the sound waveform using a linear decoder. Experimental evaluation on the GRID dataset shows that the proposed method with a single model can accurately estimate the number of speakers with 96.7 % probability of success, while achieving the state-of-the-art separation results on multi-speaker mixtures in terms of scale-invariant signal-to-noise ratio improvement (SI-SNRi) and signal-to-distortion ratio improvement (SDRi).

研究动机与目标

  • 为解决在真实应用场景中说话人数量未知时单耳语音分离的挑战,这是常见限制条件。
  • 开发一种单一深度学习模型,能够在不重新训练或修改网络结构的情况下处理可变数量的说话人。
  • 通过注意力机制融合时域与频域特征,提升分离性能。
  • 利用基于Gerschgorin圆盘分析的高维嵌入向量,实现无需阈值设定的精确说话人数量估计。
  • 通过集成深度吸引子网络(ADANet)实现鲁棒的掩码估计,使模型在不同源信号数量下均具有良好的泛化能力。

提出的方法

  • 模型使用基于注意力机制的编码器,将一维时域波形与二维频谱图融合为混合的时间-频率特征图。
  • 通过可学习的投影层将融合后的特征映射为高维嵌入向量,方法与TasNet类似。
  • 通过计算嵌入向量协方差矩阵的Gerschgorin圆盘来估计说话人数量,利用不同说话人间嵌入向量的正交性。
  • 使用深度吸引子网络(ADANet)通过测量嵌入向量与吸引子之间的相似性,生成与源信号相关的掩码。
  • 通过可学习的线性解码器将掩码后的特征反变换为波形,实现端到端训练。
  • 整个系统通过联合优化分离质量与说话人计数准确率的损失函数进行端到端训练。

实验结果

研究问题

  • RQ1能否在一个单一深度学习模型中,在不依赖先验知识的前提下,准确估计单耳混合语音中的说话人数量?
  • RQ2与单一域方法相比,基于注意力的时间-频率特征融合在分离性能上是否具有优势?
  • RQ3对嵌入向量协方差矩阵进行Gerschgorin圆盘分析,能否提供一种可靠且无需阈值设定的源信号计数方法?
  • RQ4ADANet的集成在多大程度上实现了在统一模型中对不同数量说话人的泛化能力?
  • RQ5在混合说话人数量(如两人与三人)的数据上进行训练,是否能提升在更高数量说话人情况下的性能?

主要发现

  • 所提方法在估计说话人数量上的成功概率达到96.7%,显著优于基于秩估计的基线方法(准确率为80.1%)。
  • 模型在SI-SNRi与SDRi指标上达到当前最优性能,相较于以往的频域方法,在双人混合语音中性能增益超过4 dB,在三人混合语音中增益超过6.5 dB。
  • 统一处理两人与三人混合语音的模型在处理三人混合语音时,性能优于专用的三人模型,表明从较少说话人中学习有助于向更多说话人泛化。
  • 编码器中的注意力机制增强了特征表示能力,相较于无注意力的基线模型,显著提升了分离性能。
  • 基于Gerschgorin圆盘的计数方法无需超参数调优(如阈值选择),而此前工作中的基于秩的方法则需要,因此更具优势。
  • 模型在不同说话人数量间表现出良好的泛化能力,表明单一架构可稳定处理可变数量的源信号并保持一致性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。