Skip to main content
QUICK REVIEW

[论文解读] Embeddings as representation for symbolic music

Sebastian Garcia-Valencia|arXiv (Cornell University)|May 19, 2020
Music and Audio Processing参考文献 9被引用 5
一句话总结

本文提出使用神经网络嵌入来表示符号音乐,证明学习到的向量表示能够捕捉有意义的音乐关系,如八度等价性、音程相似性以及音高类关系。通过 t-SNE 可视化,基于音符和基于音程的表示所生成的嵌入显示出对应于音乐语义的结构化聚类,表明嵌入在不改变模型架构的情况下编码了内在的音乐知识。

ABSTRACT

A representation technique that allows encoding music in a way that contains musical meaning would improve the results of any model trained for computer music tasks like generation of melodies and harmonies of better quality. The field of natural language processing has done a lot of work in finding a way to capture the semantic meaning of words and sentences, and word embeddings have successfully shown the capabilities for such a task. In this paper, we experiment with embeddings to represent musical notes from 3 different variations of a dataset and analyze if the model can capture useful musical patterns. To do this, the resulting embeddings are visualized in projections using the t-SNE technique.

研究动机与目标

  • 探究自然语言处理中的词嵌入技术是否可被适配以表示具有语义意义的符号音乐。
  • 评估学习到的嵌入是否能捕捉如八度关系和音程相似性等音乐相关模式。
  • 比较不同数据表示方式——原始音符、移调后的音符以及音程序列——在向量空间中编码音乐结构的能力。
  • 评估数据增强(移调)对嵌入质量及语义聚类的影响。

提出的方法

  • 使用具有 128 维嵌入层的单向 LSTM 模型,训练以学习音乐音符和音程的表示。
  • 使用三种数据变体:(1) 原始 MIDI 音符(对照数据集),(2) 在 12 种调性中移调的版本(DB12),(3) 连续音符之间的相对半音程。
  • 应用 t-SNE 将高维嵌入(128D)投影到 2D 和 3D 以进行可视化和模式分析。
  • 通过评估嵌入空间中的最近邻来分析语义相似性和聚类行为。
  • 使用余弦相似度测量向量空间中嵌入之间的接近程度。
  • 使用 TensorBoard 可视化结果,以解释嵌入中的聚类和结构模式。

实验结果

研究问题

  • RQ1学习到的嵌入是否能捕捉符号音乐中具有音乐意义的关系,如八度等价性和音程相似性?
  • RQ2通过移调实现的数据增强如何影响嵌入的结构和聚类?
  • RQ3基于音程的表示是否比基于音符的表示产生更一致的语义分组?
  • RQ4t-SNE 可视化是否能揭示高维嵌入空间中的可解释音乐模式?

主要发现

  • 在 DB12 数据集(含移调)上训练的嵌入将同一音符在不同八度中的表示(如 C4、C6、C8)作为最近邻,表明模型学习到了八度等价性。
  • 在对照数据集中,中央 C(C5)的最近邻跨越多个八度(如 E10、C9、E9),表明在缺乏数据增强的情况下聚类结构较弱。
  • 基于音程的嵌入模型将如小三度(3)、小二度(1)和纯四度(5)等半音程紧密聚类,表明音程空间中存在语义相似性。
  • 尽管 DB12 数据集规模为 12 倍,但仅学习到 118 个唯一嵌入,表明移调导致相同音高类的表示发生重叠。
  • t-SNE 可视化揭示了低音、中音、高音和升降半音音符的明显聚类,证实嵌入编码了音高范围和升降号作为语义特征。
  • 小三度音程(3)的最近邻包括其他常见音程,如同度(0)、小二度(1)、大二度(2)和纯四度(5),表明音程语义在嵌入空间中得以保留。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。