Skip to main content
QUICK REVIEW

[论文解读] Divide and Conquer: A Deep CASA Approach to Talker-independent Monaural Speaker Separation

Yuzhou Liu, DeLiang Wang|arXiv (Cornell University)|Apr 25, 2019
Speech and Audio Processing参考文献 40被引用 5
一句话总结

本文提出了一种用于说话人无关单声道语音分离的深度CAS A框架,将任务分为两个阶段:通过排列不变训练实现帧级谱分离,以及通过聚类实现帧级说话人追踪。该方法在WSJ0-2mix数据集上实现了最先进性能,模型紧凑,SIR、SI-SNR、PESQ和ESTOI指标均优于先前方法,同时降低了计算复杂度。

ABSTRACT

We address talker-independent monaural speaker separation from the perspectives of deep learning and computational auditory scene analysis (CASA). Specifically, we decompose the multi-speaker separation task into the stages of simultaneous grouping and sequential grouping. Simultaneous grouping is first performed in each time frame by separating the spectra of different speakers with a permutation-invariantly trained neural network. In the second stage, the frame-level separated spectra are sequentially grouped to different speakers by a clustering network. The proposed deep CASA approach optimizes frame-level separation and speaker tracking in turn, and produces excellent results for both objectives. Experimental results on the benchmark WSJ0-2mix database show that the new approach achieves the state-of-the-art results with a modest model size.

研究动机与目标

  • 为解决说话人无关单声道语音分离的挑战,即模型需在未见说话人上实现泛化。
  • 通过结合uPIT(同性别混合中说话人追踪性能差)和DC(帧级分离性能不佳)的优势,克服现有方法的局限性。
  • 通过受计算听觉场景分析(CASA)启发的两阶段深度学习框架,同时提升帧级分离与长期说话人追踪性能。
  • 相比深度聚类,通过在帧级而非时频单元级操作,降低计算复杂度。

提出的方法

  • 该方法采用两阶段策略:首先,通过排列不变神经网络实现同时分组,对每个时间帧的说话人谱进行分离。
  • 其次,通过序列分组使用聚类网络,基于学习到的嵌入将帧级谱估计分配给不同说话人。
  • 应用复杂比掩蔽以改善谱重建并减少输出中的相位失真。
  • 系统采用带频带映射层的Dense-UNet进行谱估计,以及带dropDilation的TCN进行时序建模。
  • 通过联合优化,联合训练两个阶段,使用SNR和加权聚类目标函数,以提升对齐与一致性。
  • 通过K均值聚类对帧级嵌入进行说话人追踪,将复杂度从DC中的O(FT)降低至O(T)。

实验结果

研究问题

  • RQ1能否通过结合帧级分离与帧级说话人追踪的两阶段深度学习框架,在说话人无关单声道语音分离任务中超越现有最先进方法?
  • RQ2同时分组与序列分组的联合优化如何提升帧级分离与说话人追踪性能?
  • RQ3与基于时频单元的聚类相比,帧级聚类方法是否能显著降低计算复杂度?
  • RQ4在SDR与SI-SNR指标上,该方法是否优于理想掩蔽(如IRM、PSM)?
  • RQ5与uPIT和DC相比,该模型在不同说话人组合(尤其是同性别混合)下的泛化能力如何?

主要发现

  • 该深度CASA系统在WSJ0-2mix基准上实现最先进性能,SDR相比最佳报告的uPIT方法提升0.1 dB。
  • 该方法在所有对比方法中取得最高的SI-SNR与ESTOI分数,表明语音质量与可懂度更优。
  • PESQ分数略低于最佳性能方法(FurcaNeXt),但仍具竞争力,表明感知质量良好。
  • 模型参数量显著更少(远小于TasNet与FurcaNeXt),展现出高效率。
  • 联合优化使所有指标略有提升(SDR提升0.1 dB,PESQ提升0.02,ESTOI提升0.3%),表明端到端训练具有优势。
  • 该方法在SDR与SI-SNR上优于理想掩蔽(IRM、PSM),表明学习表征优于理想化假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。