[论文解读] Learning Audio Embeddings with User Listening Data for Content-based Music Recommendation
该论文提出了一种双分支模型,通过结合用户收听历史和人口统计信息,并利用孪生网络进行度量学习,来学习音频嵌入(AEs)。以用户嵌入作为锚点,模型在喜欢/不喜欢的歌曲对上进行训练,生成基于内容的音频嵌入,实现了音乐推荐任务中的最先进性能(精确率:0.773,AUC:0.849),并在音乐流派分类准确率方面有所提升。
Personalized recommendation on new track releases has always been a challenging problem in the music industry. To combat this problem, we first explore user listening history and demographics to construct a user embedding representing the user's music preference. With the user embedding and audio data from user's liked and disliked tracks, an audio embedding can be obtained for each track using metric learning with Siamese networks. For a new track, we can decide the best group of users to recommend by computing the similarity between the track's audio embedding and different user embeddings, respectively. The proposed system yields state-of-the-art performance on content-based music recommendation tested with millions of users and tracks. Also, we extract audio embeddings as features for music genre classification tasks. The results show the generalization ability of our audio embeddings.
研究动机与目标
- 通过利用音频和用户数据,解决新歌发布时的冷启动问题。
- 通过将收听历史和人口统计特征整合到用户嵌入中,改进用户偏好建模。
- 构建一种度量学习框架,利用用户嵌入作为锚点,从音频内容中学习判别性音频嵌入。
- 评估所学习音频嵌入在音乐推荐和流派分类等下游任务中的泛化能力。
- 证明基于用户锚点的度量学习相比仅基于音频的基线方法,能生成更有效的音频表示。
提出的方法
- 使用受YouTubeDNN启发的架构训练用户分支,从收听历史和人口统计信息中生成40维用户嵌入(UE)。
- 在用户分支中使用显式和隐式反馈(如播放列表添加)作为监督信号,采用交叉熵损失进行分类。
- 在音频分支中实现共享权重的孪生网络,用于比较喜欢和不喜欢歌曲的音频嵌入。
- 将对数梅尔倒谱图输入孪生CNN,每层卷积后使用ReLU激活函数,并输出40维音频嵌入。
- 应用三元组损失(对比损失)进行度量学习,使喜欢歌曲的嵌入更接近用户嵌入,使不喜欢歌曲的嵌入更远离用户嵌入。
- 在训练过程中使用负采样,以高效优化大规模用户-歌曲交互数据上的孪生网络。
实验结果
研究问题
- RQ1能否通过综合收听历史和人口统计信息推导出的用户嵌入,提升基于内容推荐的音频嵌入质量?
- RQ2在度量学习中使用用户嵌入作为锚点,是否能相比仅基于音频的学习方法,增强音频嵌入的判别能力?
- RQ3所学习的音频嵌入在下游任务(如音乐流派分类)中的泛化能力如何?
- RQ4上下文窗口时长(如10秒)对音频嵌入模型性能有何影响?
- RQ5所提出的模型能否在音乐推荐和流派分类任务中均优于现有最先进方法?
主要发现
- 在包含6000万条用户-歌曲交互的大规模数据集上,该模型在推荐任务中取得了0.773的精确率和0.849的AUC,优于基线模型。
- 在流派分类任务中,该模型将SVM的准确率从0.7653(无AE时)提升至0.8013(GTZAN数据集),从0.5918提升至0.6148(FMA-small数据集)。
- 在MIREX 2020流派分类任务中,该模型平均准确率达到0.7474,尤其在乡村音乐、说唱/嘻哈和K-pop情歌流派的分类中表现最佳。
- 将上下文窗口扩展至10秒后,精确率和AUC均有所提升,表明更长的音频上下文有助于提升嵌入质量。
- 通过用户锚定度量学习所学习的音频嵌入在推荐和分类任务中均表现出良好的泛化能力,显示出强大的迁移能力。
- 该模型在多种音乐流派中表现稳健,尤其在K-pop和说唱/嘻哈流派中表现尤为突出,表明其对流派特异性音频模式具有高度敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。