Skip to main content
QUICK REVIEW

[论文解读] Modelling Sequential Music Track Skips using a Multi-RNN Approach

Christian Hansen, Casper Worm Hansen|arXiv (Cornell University)|Mar 20, 2019
Music and Audio Processing参考文献 10被引用 7
一句话总结

本文提出一种用于预测流媒体播放会话中连续音乐曲目跳过的多RNN模型,采用双分支堆叠LSTM架构:一个编码器网络用于建模会话的前半部分,结合会话级嵌入和曲目嵌入;一个预测器网络用于预测会话后半部分的跳过行为。该方法在Spotify连续跳过预测挑战赛中取得0.641的平均平均准确率和0.807的首次跳过预测准确率,位列45支队伍中的第2名。

ABSTRACT

Modelling sequential music skips provides streaming companies the ability to better understand the needs of the user base, resulting in a better user experience by reducing the need to manually skip certain music tracks. This paper describes the solution of the University of Copenhagen DIKU-IR team in the 'Spotify Sequential Skip Prediction Challenge', where the task was to predict the skip behaviour of the second half in a music listening session conditioned on the first half. We model this task using a Multi-RNN approach consisting of two distinct stacked recurrent neural networks, where one network focuses on encoding the first half of the session and the other network focuses on utilizing the encoding to make sequential skip predictions. The encoder network is initialized by a learned session-wide music encoding, and both of them utilize a learned track embedding. Our final model consists of a majority voted ensemble of individually trained models, and ranked 2nd out of 45 participating teams in the competition with a mean average accuracy of 0.641 and an accuracy on the first skip prediction of 0.807. Our code is released at https://github.com/Varyn/WSDM-challenge-2019-spotify.

研究动机与目标

  • 通过建模用户在连续收听会话中的跳过行为,改进音乐推荐系统。
  • 仅使用会话前半部分作为上下文,预测用户在会话后半部分将跳过的曲目。
  • 开发一种深度学习模型,捕捉时间动态和用户偏好,而无需显式用户档案。
  • 利用学习到的曲目和会话嵌入以提升跳过预测性能。
  • 在Spotify连续跳过预测挑战赛中实现最先进性能。

提出的方法

  • 该模型使用两个独立的堆叠长短期记忆(LSTM)网络:一个编码器用于处理会话的前半部分,一个预测器用于预测会话后半部分的跳过行为。
  • 编码器通过元特征(如用户会员状态、星期几、会话时长)导出的会话级嵌入进行初始化,并结合全局曲目编码。
  • 两个网络均使用结合曲目特征(如节拍强度、平坦度)与可训练嵌入层的学习曲目嵌入。
  • 输入序列对编码器进行预填充,对预测器进行后填充,以处理可变长度会话,固定序列长度为10个时间步。
  • 采用五种独立训练、批量大小不同(50–400)的模型的多数投票集成方法,以提升泛化能力和性能。
  • 模型使用Adam优化器进行训练,初始嵌入大小固定为50,LSTM层大小分别为100和500,最后的全连接层大小为500,用于跳过预测。

实验结果

研究问题

  • RQ1双分支RNN架构能否有效建模流媒体会话中的连续跳过行为?
  • RQ2与基线方法相比,学习到的会话级和曲目嵌入在多大程度上能提升跳过预测准确率?
  • RQ3使用不同批量大小训练的模型进行集成平均,是否能提升在测试集上的泛化能力和性能?
  • RQ4在仅使用会话前半部分作为输入的情况下,模型在多大程度上能预测会话后半部分的跳过行为?
  • RQ5与启发式基线相比,所提出的多RNN方法在平均平均准确率和首次跳过预测准确率方面表现如何?

主要发现

  • 所提出的多RNN模型在测试集上取得0.641的平均平均准确率,在Spotify连续跳过预测挑战赛中位列45支队伍中的第2名。
  • 首次跳过预测准确率达到0.807,显著优于所有三个基线模型,包括表现最好的基线(基线3)的0.537平均平均准确率。
  • 五种批量大小不同的模型的多数投票集成方法,性能优于表现最好的单个模型(平均平均准确率为0.638)。
  • 五种集成模型预测结果之间的平均相关系数为0.851,表明预测高度一致,支持采用多数投票策略。
  • 模型在不同批量大小下表现稳健,验证准确率在批量大小为300时达到峰值0.638。
  • 在TensorFlow中使用cuDNNLSTM实现了对1.3亿个会话数据集的高效训练,每个模型在Titan X GPU上训练了40至60小时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。