Skip to main content
QUICK REVIEW

[论文解读] Determining Song Similarity via Machine Learning Techniques and Tagging Information

Renato L. F. Cunha, Evandro Caldeira|arXiv (Cornell University)|Apr 12, 2017
Music and Audio Processing参考文献 6被引用 3
一句话总结

本文提出一种仅使用元数据(歌手、歌曲名)和用户生成标签的机器学习方法来确定歌曲相似性,结合tf-idf与k-NN模型。结果表明,tf-idf在性能上显著优于Word2Vec,k-NN在性能上也显著优于SVM与线性回归,在包含500万首歌曲的Last.fm数据集上取得了最高的R²得分。

ABSTRACT

The task of determining item similarity is a crucial one in a recommender system. This constitutes the base upon which the recommender system will work to determine which items are more likely to be enjoyed by a user, resulting in more user engagement. In this paper we tackle the problem of determining song similarity based solely on song metadata (such as the performer, and song title) and on tags contributed by users. We evaluate our approach under a series of different machine learning algorithms. We conclude that tf-idf achieves better results than Word2Vec to model the dataset to feature vectors. We also conclude that k-NN models have better performance than SVMs and Linear Regression for this problem.

研究动机与目标

  • 开发一种可扩展的、基于元数据与标签的歌曲相似性预测方法,无需依赖音频文件。
  • 评估NLP技术(如tf-idf与Word2Vec)在从文本元数据与标签中建模歌曲特征向量方面的有效性。
  • 比较多种机器学习算法(k-NN、SVM与线性回归)在预测歌曲相似性方面的性能表现。
  • 利用用户收听历史中歌曲对的共现关系建立真实相似性度量作为基准。
  • 识别在歌曲相似性预测中最具效果的特征表示与学习算法组合。

提出的方法

  • 数据集通过Last.fm API收集,包含歌曲元数据、用户标签以及13800万对歌曲的基于共现的相似性得分。
  • 对文本进行了归一化处理,以去除变音符号、特殊字符,并将Unicode字符转换为最接近的拉丁字符等效形式,同时将多词术语(如“Rolling Stones”)合并为单个标记。
  • 采用两种NLP技术构建特征向量:tf-idf(将每首歌曲的标签视为一个文档)与Word2Vec(使用标签向量的加权平均,权重为标签出现次数)。
  • k-NN模型使用特征向量之间的余弦相似度进行相似性预测,性能通过R²得分评估。
  • 将数据集过滤为三种版本:原始数据、s>1%与s>2.5%,以评估对低相似性对的敏感性。
  • 模型评估使用了10万个采样歌曲,划分为训练集与测试集,R²作为主要指标以评估模型拟合程度。

实验结果

研究问题

  • RQ1在从元数据与标签预测相似性时,tf-idf是否比Word2Vec产生更有效的歌曲特征表示?
  • RQ2在使用文本特征预测歌曲相似性时,k-NN、SVM与线性回归模型的性能表现如何比较?
  • RQ3过滤掉低相似性歌曲对(s < 1% 或 s < 2.5%)是否能提升模型性能?
  • RQ4基于用户收听历史中歌曲对共现关系的相似性度量是否可作为歌曲相似性的有效且可靠的基准?
  • RQ5为何在此情境下k-NN优于SVM与线性回归等更复杂的模型?

主要发现

  • tf-idf在预测歌曲相似性方面表现优于Word2Vec,所有数据过滤条件下均获得了更高的R²得分。
  • k-NN模型在性能上优于SVM与线性回归,取得了最高的R²得分,尤其在原始数据集上,最佳k-NN模型在k=10时达到R²=0.305。
  • 在原始数据集上表现最佳的k-NN模型取得了R²得分为0.305,显著优于均值预测器(R² = 0),表明其具备有意义的预测能力。
  • SVM(SVR)在所有模型中表现最差,所有配置下的R²得分均低于0.2,且在某些过滤设置下甚至出现负分。
  • 过滤掉低相似性对(s>1% 或 s>2.5%)导致所有模型性能下降,尤其对k-NN影响显著,其R²分别降至0.105与0.069,表明低相似性对有助于模型泛化。
  • 线性回归模型表现极差,R²得分接近零,表明其效果几乎等同于直接预测数据集的均值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。