Skip to main content
QUICK REVIEW

[论文解读] Large-Scale Cover Song Detection in Digital Music Libraries Using Metadata, Lyrics and Audio Features

Albin Andrew Correya, Romain Hennequin|arXiv (Cornell University)|Aug 30, 2018
Music and Audio Processing参考文献 20被引用 7
一句话总结

本文提出一种多模态方法,通过结合歌曲元数据(标题)、歌词(基于MXM数据集)和音频特征,实现大规模翻唱歌曲检测。采用标准的tf-idf文本相似度计算与最先进的音频方法。与仅使用音频的最先进方法相比,该方法在百万首歌曲数据集(Million Song Dataset)上的平均平均精度(MAP)提升了35.5%,证明文本特征能显著提升数字音乐库中翻唱检测的准确性和可扩展性。

ABSTRACT

Cover song detection is a very relevant task in Music Information Retrieval (MIR) studies and has been mainly addressed using audio-based systems. Despite its potential impact in industrial contexts, low performances and lack of scalability have prevented such systems from being adopted in practice for large applications. In this work, we investigate whether textual music information (such as metadata and lyrics) can be used along with audio for large-scale cover identification problem in a wide digital music library. We benchmark this problem using standard text and state of the art audio similarity measures. Our studies shows that these methods can significantly increase the accuracy and scalability of cover detection systems on Million Song Dataset (MSD) and Second Hand Song (SHS) datasets. By only leveraging standard tf-idf based text similarity measures on song titles and lyrics, we achieved 35.5% of absolute increase in mean average precision compared to the current scalable audio content-based state of the art methods on MSD. These experimental results suggests that new methodologies can be encouraged among researchers to leverage and identify more sophisticated NLP-based techniques to improve current cover song identification systems in digital music libraries with metadata.

研究动机与目标

  • 探究元数据和歌词是否能在仅使用音频的方法之外,显著提升大规模翻唱歌曲检测的可扩展性和准确性。
  • 在真实世界音乐数据集上,对基于文本的相似度度量方法(标题和歌词的tf-idf)与最先进的音频系统进行基准比较。
  • 评估在可扩展的多模态框架中,结合文本与音频特征在数字音乐库中翻唱检测方面的有效性。
  • 为未来基于公开数据集(如MSD、SHS和MXM)的文本增强翻唱歌曲检测研究,提供可复现且开源的基线。

提出的方法

  • 使用标准的tf-idf向量化方法处理文本特征(歌曲标题和歌词),以计算曲目之间的语义相似度。
  • 通过CENS(音符能量归一化统计)提取音频特征,并利用动态时间规整(DTW)进行对齐,以计算相似度。
  • 采用混合重排序策略:首先基于文本结果进行初步检索,再使用最先进的音频相似度方法(Serra et al., 2017)结合低距离阈值(h=0.1)进行优化。
  • 在百万首歌曲数据集(MSD)、Second Hand Song(SHS)的训练/测试集以及MXM数据集(用于歌词)上对框架进行了评估。
  • 对音频特征应用关键不变性技术,如OTI(最优转调指数)和节拍同步的色度图,以确保对调性与节拍变化的鲁棒性。
  • 系统采用查询-检索设置,将每首查询歌曲与大型参考数据库进行匹配,以检索并排序翻唱候选曲目。

实验结果

研究问题

  • RQ1基于文本的特征(如歌曲标题和歌词)是否能显著提升大规模翻唱歌曲检测系统的准确性?
  • RQ2在大规模数据集上,基于tf-idf的文本相似度方法与最先进的音频方法在平均平均精度(MAP)方面的表现如何比较?
  • RQ3在真实世界的数字音乐库中,结合文本与音频特征在多大程度上能提升可扩展性和检索性能?
  • RQ4使用音频相似度模型对基于文本的结果进行重排序,是否能进一步提升检测准确性?

主要发现

  • 仅使用歌曲标题和MXM歌词的所提方法,在百万首歌曲数据集上的平均平均精度(MAP)相比当前仅使用音频的最先进方法,绝对提升了35.5%。
  • 在SHS测试集上,标题与MXM歌词的组合在使用音频方法重排序(h=0.1)后,MAP达到0.510,提升了2.1%。
  • 使用预处理后的标题(pre-title)与原始标题相比,性能相当,表明对标题的微小变化具有鲁棒性。
  • 在MSD-DZR数据集(排除官方重复曲目)上,该方法的MAP达到0.489,显示出在大规模数据上的强劲性能。
  • 仅使用文本特征的方法优于以往仅使用音频的可扩展系统,后者在SHS训练集上的MAP仅为0.28。
  • 结果表明,文本特征在翻唱检测中极为有效且可解释,尤其在音频数据不可用或可扩展性为关键考量时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。