Skip to main content
QUICK REVIEW

[论文解读] Uncovering audio patterns in music with Nonnegative Tucker Decomposition for structural segmentation

Axel Marmoret, Jérémy E. Cohen|arXiv (Cornell University)|Oct 11, 2020
Music and Audio Processing参考文献 2被引用 5
一句话总结

本文提出对时间-频率-小节三阶张量表示进行非负Tucker分解(NTD),以在流行音乐中揭示小节尺度的音乐模式,实现有效的结构分割。该方法在最优秩选择下实现了具有竞争力的分割性能——超越基线方法并接近最先进水平,展示了NTD在稀疏、可解释音频特征学习方面的潜力。

ABSTRACT

Recent work has proposed the use of tensor decomposition to model repetitions and to separate tracks in loop-based electronic music. The present work investigates further on the ability of Nonnegative Tucker Decompositon (NTD) to uncover musical patterns and structure in pop songs in their audio form.Exploiting the fact that NTD tends to express the content of bars as linear combinations of a few patterns, we illustrate the ability of the decomposition to capture and single out repeated motifs in the corresponding compressed space, which can be interpreted from a musical viewpoint. The resulting features also turn out to be efficient for structural segmentation, leading to experimental results on the RWC Pop data set which are potentially challenging state-of-the-art approaches that rely on extensive example-based learning schemes.

研究动机与目标

  • 开发一种稀疏、可解释的音频表示,以捕捉流行歌曲中的中长期音乐结构。
  • 探究非负Tucker分解(NTD)是否能从原始音频谱图中提取显著的小节尺度模式。
  • 评估基于NTD的特征在RWC流行音乐数据集上的结构分割有效性。
  • 将基于NTD的分割方法与盲方法及数据密集型最先进方法进行比较。

提出的方法

  • 将音乐表示为大小为F×T×B的三阶张量X,其中F=12(音高类),T为每小节的帧数,B为总小节数,利用常数Q变换生成的音高类图。
  • 应用非负Tucker分解(NTD)将X分解为核心张量𝒢与三个非负因子矩阵W、H、Q,实现低秩压缩。
  • 利用核心张量和因子矩阵重建每个小节的压缩表示,通过少量基成分的线性组合实现模式发现。
  • 从压缩表示构建自相似矩阵,以检测重复的音乐动机和结构边界。
  • 通过交叉验证和最优秩选择优化NTD的秩T′和B′,以最大化分割F-measure。
  • 使用0.5秒和3秒容差窗口,通过精确率、召回率和F-measure评估分割性能,并与基线方法及基于原始音高类图的自相似矩阵进行比较。

实验结果

研究问题

  • RQ1非负Tucker分解能否从原始音频中有效揭示流行音乐中小节尺度的重复音乐动机?
  • RQ2基于NTD的特征表示在结构分割中与原始时频表示相比表现如何?
  • RQ3秩选择(T′, B′)对分割性能有何影响?能否通过类似最优选择的秩选择方法获得性能上限?
  • RQ4基于NTD的方法是否优于盲分割方法,并可能与数据密集型最先进技术相媲美?
  • RQ5NTD表示在多大程度上增强了自相似矩阵的对比度,以利于结构边界检测?

主要发现

  • 在现实的交叉验证条件下,基于NTD的分割优于基线盲方法,在RWC流行音乐数据集上取得了具有竞争力的F-measure得分。
  • 在最优秩选择条件下,NTD的F-measure高于最先进方法,表明结合有效的秩选择时,其具有强大的潜力。
  • 基于NTD的自相似矩阵对比度优于原始音高类图生成的矩阵,有助于更清晰地检测结构边界。
  • 该方法自然地使分割边界与强拍对齐,这在流行音乐中可能构成优势,因为音乐段落通常从强拍开始。
  • 核心张量和因子矩阵在压缩表示中揭示了可解释的音乐模式,如重复的和弦进行与旋律动机。
  • T′和B′的秩显著影响性能,交叉验证中最优值为40和28(奇数歌曲)或48和24(偶数歌曲),而在最优秩选择条件下则因歌曲而异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。