Skip to main content
QUICK REVIEW

[论文解读] Determined BSS based on time-frequency masking and its application to harmonic vector analysis

Kohei Yatabe, Daichi Kitamura|arXiv (Cornell University)|Apr 29, 2020
Speech and Audio Processing参考文献 68被引用 4
一句话总结

本文提出谐波向量分析(HVA),一种基于倒谱稀疏性的时频掩码建模音频源的确定性盲源分离(BSS)方法,以增强谐波结构。通过将该掩码集成到即插即用的原始-对偶分裂框架中,HVA在计算成本更低的情况下实现了与最先进ILRMA相当的性能,尤其在语音和音乐分离任务中表现更优。

ABSTRACT

This paper proposes harmonic vector analysis (HVA) based on a general algorithmic framework of audio blind source separation (BSS) that is also presented in this paper. BSS for a convolutive audio mixture is usually performed by multichannel linear filtering when the numbers of microphones and sources are equal (determined situation). This paper addresses such determined BSS based on batch processing. To estimate the demixing filters, effective modeling of the source signals is important. One successful example is independent vector analysis (IVA) that models the signals via co-occurrence among the frequency components in each source. To give more freedom to the source modeling, a general framework of determined BSS is presented in this paper. It is based on the plug-and-play scheme using a primal-dual splitting algorithm and enables us to model the source signals implicitly through a time-frequency mask. By using the proposed framework, determined BSS algorithms can be developed by designing masks that enhance the source signals. As an example of its application, we propose HVA by defining a time-frequency mask that enhances the harmonic structure of audio signals via sparsity of cepstrum. The experiments showed that HVA outperforms IVA and independent low-rank matrix analysis (ILRMA) for both speech and music signals. A MATLAB code is provided along with the paper for a reference ( https://doi.org/10.24433/CO.9507820.v1 ).

研究动机与目标

  • 开发一种基于时频掩码的确定性BSS通用框架,以实现灵活的源建模。
  • 解决现有BSS方法(如IVA和ILRMA)在显式建模音频信号中谐波结构方面的局限性。
  • 提出一种新型BSS算法HVA,通过倒谱稀疏性增强谐波内容,同时保持计算效率。
  • 证明所提出的基于掩码的BSS框架可通过掩码设计轻松集成多种源先验。
  • 提供一种计算高效的ILRMA替代方案,在无需迭代秩优化的情况下,对语音和音乐信号均表现良好。

提出的方法

  • 本文提出一种基于原始-对偶分裂算法的即插即用BSS框架,支持任意时频掩码的模块化集成,用于源增强。
  • 通过最小化包含对数行列式项(用于独立性)和源自特定源掩码的惩罚函数的代价函数来估计分离矩阵。
  • HVA通过设计一种自定义时频掩码实现,该掩码通过倒谱域的稀疏性来促进谐波结构。
  • 掩码通过频率方向的傅里叶变换对和指数映射计算,以在时频表示中突出谐波分量。
  • 优化过程通过邻近分裂算法求解,即使在复杂掩码函数下也能实现高效且稳定的收敛。
  • 该框架支持批量处理,并允许组合使用多个掩码,为未来多准则源分离的扩展提供了可能。

实验结果

研究问题

  • RQ1基于时频掩码的通用BSS框架是否能比现有方法(如IVA和ILRMA)实现更灵活、更有效的源建模?
  • RQ2一种基于倒谱的掩码若能促进谐波结构,在分离语音和音乐信号方面与最先进BSS方法相比表现如何?
  • RQ3所提出的即插即用掩码框架是否允许高效且模块化地开发新型BSS算法,而无需重新设计整个优化流程?
  • RQ4在多通道场景下,HVA与ILRMA在迭代时间与收敛速度方面的计算权衡如何?
  • RQ5HVA在非谐波信号上的泛化能力如何?需要何种修改以扩展其适用范围?

主要发现

  • 在语音和音乐分离任务中,HVA性能与ILRMA相当,200次迭代设置下表现出强收敛性和低误差率。
  • 在2通道混合信号中,尽管ILRMA具备建模重复谱模式的能力,HVA在λ = 0.08时性能仍与之相当,表明其谐波建模有效。
  • 在含鼓声(非谐波)的3通道混合信号中,IVA优于ILRMA,但HVA仍达到相当性能,表明对混合源类型的鲁棒性。
  • 在Core i7-8700处理器上,HVA处理语音每迭代耗时60.8毫秒,音乐为164.3毫秒,优于ILRMA(分别为116.1毫秒和271.2毫秒),但低于IVA。
  • 由于收敛更快(如Mixture A和B仅需20–50次迭代),尽管单次迭代成本较高,HVA的总运行时间通常低于ILRMA。
  • 基于掩码的框架可通过组合多个掩码轻松扩展,如先前工作所示,表明通过多准则掩码设计具有强大的未来改进潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。