Skip to main content
QUICK REVIEW

[论文解读] Generating Music Medleys via Playing Music Puzzle Games

Yu-Siang Huang, Szu-Yu Chou|arXiv (Cornell University)|Sep 13, 2017
Music and Audio Processing参考文献 29被引用 4
一句话总结

本文提出了一种名为相似性嵌入网络(Similarity Embedding Network, SEN)的自监督学习方法,通过解决音乐拼图游戏(即按正确时间顺序排列音频片段)来训练神经网络生成音乐混剪。通过学习帧级别的相似性矩阵并将其嵌入共享空间,SEN在音乐拼图、序列排序和混剪任务中均优于基线模型,在采用节拍信息分割的混剪游戏中实现了0.790和0.750的全局准确率。

ABSTRACT

Generating music medleys is about finding an optimal permutation of a given set of music clips. Toward this goal, we propose a self-supervised learning task, called the music puzzle game, to train neural network models to learn the sequential patterns in music. In essence, such a game requires machines to correctly sort a few multisecond music fragments. In the training stage, we learn the model by sampling multiple non-overlapping fragment pairs from the same songs and seeking to predict whether a given pair is consecutive and is in the correct chronological order. For testing, we design a number of puzzle games with different difficulty levels, the most difficult one being music medley, which requiring sorting fragments from different songs. On the basis of state-of-the-art Siamese convolutional network, we propose an improved architecture that learns to embed frame-level similarity scores computed from the input fragment pairs to a common space, where fragment pairs in the correct order can be more easily identified. Our result shows that the resulting model, dubbed as the similarity embedding network (SEN), performs better than competing models across different games, including music jigsaw puzzle, music sequencing, and music medley. Example results can be found at our project website, https://remyhuang.github.io/DJnet.

研究动机与目标

  • 开发一种基于音频片段排序作为监督信号的自监督方法,用于学习音乐中的顺序模式。
  • 解决从同一首或不同歌曲中排序多秒、非重叠音乐片段的挑战。
  • 将自动音乐混剪生成作为顺序音频理解的实际应用。
  • 通过在共享嵌入空间中学习帧级别相似性矩阵,改进现有孪生网络。

提出的方法

  • 该模型使用孪生卷积网络处理音频片段对,并计算它们之间的帧级别相似性得分。
  • 从这些得分构建相似性矩阵,表示片段对之间的时序对齐与结构一致性。
  • 网络学习将相似性矩阵嵌入到一个共同空间中,使得顺序正确(正样本)的片段对比顺序错误(负样本)的片段对更容易分离。
  • 该方法采用成对评估策略,评估n(n−1)对片段而非全部n!种排列,从而实现对更大片段集合的可扩展性。
  • 使用节拍追踪生成在音乐上具有意义的、非重叠的片段,提升模型泛化能力。
  • 训练中使用三种类型的负样本对:R1R3、R2R1和R3R1,消融实验表明,同时使用三类负样本可提升性能。

实验结果

研究问题

  • RQ1基于音乐拼图游戏的自监督学习框架能否有效学习音频中的顺序模式?
  • RQ2所提出的SEN模型在排序来自同一首或不同歌曲的音频片段方面,与现有孪生网络相比表现如何?
  • RQ3基于节拍信息的分割在多大程度上提升了模型学习音乐上有意义模式的能力?
  • RQ4该模型能否泛化到复杂任务如音乐混剪生成(片段来自不同歌曲)?
  • RQ5哪些类型的负样本训练样本最能有效提升模型对正确时间顺序的判别能力?

主要发现

  • 当使用节拍信息分割进行训练时,SEN模型在音乐混剪游戏中实现了0.790的全局准确率,显著优于基线模型。
  • 在训练中同时使用全部三种负样本对(R1R3、R2R1、R3R1)可获得最佳性能,仅使用R2R1对无法达到最优结果。
  • 该模型不仅能区分顺序正确与错误的样本对,还能区分连续(R2R1)与非连续(R1R3、R3R1)的样本对,表明其对序列结构具有敏感性。
  • 消融实验表明,将余弦相似度替换为内积会损害性能,原因在于缺乏归一化的相似度得分。
  • 该模型在预测中保持了局部顺序,许多错误预测仍具有音乐上的合理性,原因在于局部片段的序列排列正确。
  • 对学习特征的可视化显示,卷积滤波器能检测到相似性矩阵中的显著模式与纹理,证实模型捕捉到了有意义的结构信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。