Skip to main content
QUICK REVIEW

[论文解读] Modeling Musical Context with Word2vec

Dorien Herremans, Ching‐Hua Chuan|arXiv (Cornell University)|Jun 28, 2017
Music and Audio Processing参考文献 16被引用 14
一句话总结

本文提出一种基于 word2vec 的 skip-gram 模型,结合负采样方法,从贝多芬钢琴奏鸣曲中学习音乐片段的语义向量表示,将多声部音乐视为富含上下文的片段序列。该模型在未使用显式音乐特征的情况下捕捉了音高关系,基于余弦相似度的替换能保持较低的音高距离,表明通过分布语义学有效建模了音乐上下文。

ABSTRACT

We present a semantic vector space model for capturing complex polyphonic musical context. A word2vec model based on a skip-gram representation with negative sampling was used to model slices of music from a dataset of Beethoven's piano sonatas. A visualization of the reduced vector space using t-distributed stochastic neighbor embedding shows that the resulting embedded vector space captures tonal relationships, even without any explicit information about the musical contents of the slices. Secondly, an excerpt of the Moonlight Sonata from Beethoven was altered by replacing slices based on context similarity. The resulting music shows that the selected slice based on similar word2vec context also has a relatively short tonal distance from the original slice.

研究动机与目标

  • 探究 word2vec 模型是否能在不依赖显式音乐特征(如和弦或节奏)的情况下,建模复杂的多声部音乐上下文。
  • 评估向量空间中的语义相似性是否对应于音乐中的音高接近性。
  • 通过基于上下文相似性的音乐片段替换并评估音高连续性,测试该模型的实际效用。
  • 探索基于神经网络的分布语义学在音乐表征中的潜力,超越传统音乐学特征。

提出的方法

  • 基于音符触发之间最频繁的时间间隔,将每首音乐作品表示为非重叠且等长的片段。
  • 将每个片段视为语料库中的一个“词”,保留所有活跃音符,包括延音。
  • 训练一个带有负采样的 skip-gram 模型,以在高维空间中学习音乐片段的密集向量表示。
  • 使用片段向量之间的余弦相似度,识别在上下文中相似的音乐片段。
  • 应用 t-SNE 降低并可视化高维向量空间,映射音高关系。
  • 将音乐片段中原有的片段替换为模型中上下文最相似的片段,并使用基于音程图(tonnetz)的度量方法测量音高距离。

实验结果

研究问题

  • RQ1在未经显式音乐特征工程的情况下,基于原始音乐片段训练的 word2vec 模型能否学习到有意义的音乐上下文表示?
  • RQ2即使未直接提供音高或和弦信息,所得的向量空间是否仍能反映如纯五度或增四度等音高关系?
  • RQ3基于 word2vec 相似度替换音乐片段在多大程度上能保持音乐片段中音高的连续性?
  • RQ4该模型如何处理跨越多个片段的持续音?这揭示了哪些局限性?
  • RQ5该模型能否推广到孤立和弦之外的音乐结构,例如复杂的多声部织体?

主要发现

  • 学习到的向量空间的 t-SNE 可视化显示,音高相关的和弦(如 C 和 G,相距纯五度)倾向于聚集在一起,即使没有显式的音高信息。
  • 具有较远音高关系的音乐片段(如 E 和 Eb)在降维空间中形成独立的聚类,证实音高接近性被编码在嵌入向量中。
  • 当原始片段被基于余弦相似度的最相似片段替换后,原始片段与修改后片段之间的平均音高距离保持较低(例如,D♭ 大三和弦替换的平均距离为 1.25)。
  • 模型成功捕捉了多声部音乐中的上下文相似性,这从修改后音乐片段的感知连续性和定量连续性中得到证实。
  • 该模型未捕捉声部进行约束,例如在调整音区后可实现更优的声部进行,表明其在建模声部独立性方面存在局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。