Skip to main content
QUICK REVIEW

[论文解读] Speeding Up Permutation Invariant Training for Source Separation

Thilo von Neumann, Christoph Böddeker|arXiv (Cornell University)|Jul 30, 2021
Speech and Audio Processing参考文献 18被引用 6
一句话总结

本文提出将排列不变训练(PIT)损失高效分解为一个得分矩阵和一个严格单调递增函数,使语音级PIT可通过匈牙利算法实现多项式时间求解,图PIT则通过动态规划实现。该方法将计算复杂度从阶乘时间降低至多项式时间,使大规模说话人数量或长时录音的训练成为可能。

ABSTRACT

Permutation invariant training (PIT) is a widely used training criterion for neural network-based source separation, used for both utterance-level separation with utterance-level PIT (uPIT) and separation of long recordings with the recently proposed Graph-PIT. When implemented naively, both suffer from an exponential complexity in the number of utterances to separate, rendering them unusable for large numbers of speakers or long realistic recordings. We present a decomposition of the PIT criterion into the computation of a matrix and a strictly monotonously increasing function so that the permutation or assignment problem can be solved efficiently with several search algorithms. The Hungarian algorithm can be used for uPIT and we introduce various algorithms for the Graph-PIT assignment problem to reduce the complexity to be polynomial in the number of utterances.

研究动机与目标

  • 解决朴素排列不变训练(PIT)在语音分离中因说话人数量多或录音时间长而导致的指数级计算复杂度问题。
  • 通过重述损失函数,将图PIT分配问题的NP难复杂度降低至多项式时间,实现高效优化。
  • 实现对高说话人数量的语音级和连续语音分离(CSS)神经网络的实用化训练。
  • 使PIT中分配步骤的运行时间相对于神经网络前向/反向传播可忽略不计。
  • 通过将损失分解为矩阵与单调函数,构建一个适用于uPIT与Graph-PIT的通用框架。

提出的方法

  • 将PIT损失分解为得分矩阵M与一个严格单调递增函数,实现高效优化。
  • 应用匈牙利算法在O(K³)时间内求解语音级PIT分配问题,其中K为说话人数量。
  • 将图PIT分配问题建模为图着色问题,并使用动态规划在与语音段数量线性相关的复杂度下求解。
  • 利用预计算的损失矩阵,避免对每个排列重复计算完整损失,显著减少冗余计算。
  • 实现多种分配算法(包括暴力搜索、分支限界法、深度优先搜索与动态规划)以进行对比评估。
  • 通过使用点积替代MSE计算矩阵,进一步降低运行时间,尤其在K较大时效果显著。

实验结果

研究问题

  • RQ1能否通过损失函数的分解,在多项式时间内求解语音级PIT的排列问题?
  • RQ2是否可通过损失函数的重述,将图PIT分配问题的NP难复杂度降低至多项式时间?
  • RQ3对于图PIT,不同分配算法(如动态规划、分支限界法)在运行时间与最优性方面如何比较?
  • RQ4在大规模数据集(含大量说话人)中,分配步骤对整体训练时间的影响如何?
  • RQ5所提出的框架能否在极少架构修改下推广至uPIT与Graph-PIT?

主要发现

  • 匈牙利算法将uPIT分配时间降至O(K³),使100个说话人的训练在1秒内完成。
  • 动态规划以与语音段数量线性相关的复杂度求解图PIT分配问题,获得最优解。
  • 使用优化后的匈牙利算法时,分配步骤的运行时间在实际场景下可忽略不计(<10 ms),即使面对100个说话人亦然。
  • 对于超过15个语音段的情况,暴力搜索与分支限界法等指数时间算法主导了训练时间,未优化版本在15个语音段时耗时超过40秒。
  • 预计算得分矩阵方法显著减少了冗余损失计算,使用点积替代MSE进一步加速了矩阵运算。
  • 该框架使长时录音中高说话人数量的Graph-PIT训练成为可能,多数情况下无需再进行拼接处理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。