Skip to main content
QUICK REVIEW

[论文解读] Sequential Skip Prediction with Few-shot in Streamed Music Contents

Sungkyun Chang, Seungjin Lee|arXiv (Cornell University)|Jan 24, 2019
Music and Audio Processing参考文献 12被引用 5
一句话总结

本文提出了一种基于声学特征和用户交互日志的少样本序列跳过预测模型,用于流媒体音乐场景。比较了度量学习与序列学习方法,发现采用因果空洞卷积和高速公路激活的序列学习方法显著优于度量学习,在验证集上达到63.8%的MAA,当在查询阶段使用完整用户日志时性能进一步提升。

ABSTRACT

This paper provides an outline of the algorithms submitted for the WSDM Cup 2019 Spotify Sequential Skip Prediction Challenge (team name: mimbres). In the challenge, complete information including acoustic features and user interaction logs for the first half of a listening session is provided. Our goal is to predict whether the individual tracks in the second half of the session will be skipped or not, only given acoustic features. We proposed two different kinds of algorithms that were based on metric learning and sequence learning. The experimental results showed that the sequence learning approach performed significantly better than the metric learning approach. Moreover, we conducted additional experiments to find that significant performance gain can be achieved using complete user log information.

研究动机与目标

  • 为在线音乐流媒体中的序列跳过预测问题提出少样本学习方法,其中仅在听音会话的后半段可获取声学特征。
  • 评估度量学习与序列学习在从部分听音会话中捕捉用户行为模式方面的优劣。
  • 探究在查询阶段引入完整用户交互日志对跳过预测性能的影响。
  • 探索从使用完整查询信息训练的教师模型中蒸馏知识,以提升学生模型性能。

提出的方法

  • 提出一种基于度量学习的模型,利用关系网络(RN)在学习到的潜在空间中计算支持集与查询集曲目之间的成对相似度。
  • 提出一种改进的关系网络(rnbc2-UE),直接预测跳过标签而非相似度分数,并增加嵌入层以建模用户偏好。
  • 开发一种序列学习模型(seq1HL),采用堆叠的因果空洞卷积层,结合高速公路或门控线性单元(GLU)激活,以建模听音序列中的时间依赖性。
  • 采用注意力增强的变体(att(seq1eH(S), seq1eH(Q))),使用非因果编码器对支持集和查询集进行编码,以捕捉长程上下文信息。
  • 使用二元交叉熵损失进行序列学习训练,度量学习则使用均方误差损失,优化器为Adam,并采用早停策略。
  • 使用查询阶段的用户日志和声学特征联合训练教师模型,以评估完整信息带来的收益。

实验结果

研究问题

  • RQ1当仅在查询阶段拥有声学特征时,度量学习能否有效预测流媒体音乐中的跳过行为?
  • RQ2在少样本跳过预测任务中,结合时间建模的序列学习是否优于度量学习?
  • RQ3在查询阶段提供完整用户交互日志时,性能可提升多少?
  • RQ4从使用完整查询数据训练的教师模型中蒸馏知识,能否提升学生模型性能?

主要发现

  • 基于序列学习的模型(seq1HL)在验证集上达到63.8%的MAA,显著优于最佳度量学习模型(rnbc2-UE)的57.4% MAA,性能提升6.4个百分点。
  • 序列学习方法在所有设置下均优于度量学习至少5.9个百分点,表明时间建模在跳过预测中更具有效性。
  • 注意力机制模型(att(seq1eH(S), seq1eH(Q)))达到63.3%的MAA,表明注意力机制有效,但性能未超越更简单的因果架构。
  • 使用完整查询信息(用户日志 + 声学特征)训练的教师模型达到84.9%的MAA,相比最佳学生模型提升21.1个百分点,凸显完整查询数据的价值。
  • 消融实验证明,加入用户偏好嵌入和直接标签预测使度量学习性能相比基线提升1.4个百分点。
  • 表现最佳的模型(seq1HL)采用双堆叠架构,结合空洞卷积与高速公路单元,表明更深层次的时间建模可提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。