Skip to main content
QUICK REVIEW

[论文解读] A Novel Audio Representation for Music Genre Identification in MIR

Navin Kamuni, Mayank Jindal|arXiv (Cornell University)|Apr 1, 2024
Music and Audio Processing被引用 4
一句话总结

本文评估了基于 Jukebox 生成模型的新型音频表征在音乐信息检索(MIR)中用于音乐流派识别的表现。在与当前最优水平相当的数据集上,采用基于 Transformer 的分类器进行实验,研究发现 Jukebox 的表征并未优于标准的梅尔频谱图,这可能是因为其表征缺乏与人类听觉感知的对齐,尽管采用了深度向量量化方法。

ABSTRACT

For Music Information Retrieval downstream tasks, the most common audio representation is time-frequency-based, such as Mel spectrograms. In order to identify musical genres, this study explores the possibilities of a new form of audio representation one of the most usual MIR downstream tasks. Therefore, to discretely encoding music using deep vector quantization; a novel audio representation was created for the innovative generative music model i.e. Jukebox. The effectiveness of Jukebox's audio representation is compared to Mel spectrograms using a dataset that is almost equivalent to State-of-the-Art (SOTA) and an almost same transformer design. The results of this study imply that, at least when the transformers are pretrained using a very modest dataset of 20k tracks, Jukebox's audio representation is not superior to Mel spectrograms. This could be explained by the fact that Jukebox's audio representation does not sufficiently take into account the peculiarities of human hearing perception. On the other hand, Mel spectrograms are specifically created with the human auditory sense in mind.

研究动机与目标

  • 探究 Jukebox 的深度向量量化音频表征是否能提升 MIR 中的音乐流派识别性能。
  • 在相同模型和数据条件下,比较 Jukebox 表征与标准梅尔频谱图的性能表现。
  • 评估 Jukebox 的生成预训练是否能为下游 MIR 任务生成更有效的表征。
  • 探究 Jukebox 表征中缺乏对人类听觉感知的建模是否限制了其在 MIR 任务中的有效性。
  • 确定该表征的性能是否对预训练数据规模敏感。

提出的方法

  • 研究采用相同的基于 Transformer 的分类器架构处理两种表征,以确保公平比较。
  • 通过 Jukebox 学习到的向量量化变分自编码器(VAE)提取其音频表征,从原始音频生成离散潜在码。
  • 使用标准的梅尔滤波器组计算梅尔频谱图,这是 MIR 领域中广泛认可的基线方法。
  • 模型在约 20,000 首曲目的数据集上进行微调,属于适度规模的预训练数据。
  • 通过音乐流派分类的标准指标(如准确率和 F1 分数)评估性能。
  • 在相同的训练与评估协议下进行比较,以隔离音频表征本身的影响。

实验结果

研究问题

  • RQ1Jukebox 的向量量化音频表征是否在音乐流派分类中优于梅尔频谱图?
  • RQ2当使用相同的 Transformer 架构和相同的数据集规模时,Jukebox 表征与梅尔频谱图的性能表现如何比较?
  • RQ3Jukebox 表征中缺乏对人类听觉感知的建模,在多大程度上影响了其在 MIR 任务中的表现?
  • RQ4两种表征之间的性能差距是否对预训练数据规模敏感?
  • RQ5生成模型学习到的表征是否能在下游 MIR 任务中与手工设计的表征(如梅尔频谱图)相媲美?

主要发现

  • 在音乐流派识别任务中,Jukebox 的音频表征并未展现出优于梅尔频谱图的性能。
  • 在所有评估指标上,使用 Jukebox 表征的 Transformer 模型性能均持续低于使用梅尔频谱图的模型。
  • 研究将性能不足归因于 Jukebox 的表征未针对人类听觉感知进行优化,而梅尔频谱图则具备这一特性。
  • 即使在仅 20,000 首曲目的适度规模预训练数据集下,梅尔频谱图仍保持性能优势。
  • 结果表明,手工设计的表征(如梅尔频谱图)在该下游任务中仍具竞争力或更优。
  • 研究结果表明,仅靠生成预训练并不能保证为 MIR 任务带来更优的表征学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。