Skip to main content
QUICK REVIEW

[論文レビュー] Modelling Sequential Music Track Skips using a Multi-RNN Approach

Christian Hansen, Casper Worm Hansen|arXiv (Cornell University)|Mar 20, 2019
Music and Audio Processing参考文献 10被引用数 7
ひとこと要約

本論文では、ストリーミングセッション内の順序的な音楽トラックスキップを予測するためのマルチRNNモデルを提案する。2本のスタックされたLSTMアーキテクチャを用い、1本のエンコーダーネットワークがセッション全体の特徴とトラック埋め込みを用いてセッションの前半をモデル化し、もう1本の予測ネットワークがセッションの後半におけるスキップを予測する。この手法は、平均平均正解率0.641および最初のスキップ予測正解率0.807を達成し、Spotify順序的スキップ予測チャレンジで45チーム中2位となった。

ABSTRACT

Modelling sequential music skips provides streaming companies the ability to better understand the needs of the user base, resulting in a better user experience by reducing the need to manually skip certain music tracks. This paper describes the solution of the University of Copenhagen DIKU-IR team in the 'Spotify Sequential Skip Prediction Challenge', where the task was to predict the skip behaviour of the second half in a music listening session conditioned on the first half. We model this task using a Multi-RNN approach consisting of two distinct stacked recurrent neural networks, where one network focuses on encoding the first half of the session and the other network focuses on utilizing the encoding to make sequential skip predictions. The encoder network is initialized by a learned session-wide music encoding, and both of them utilize a learned track embedding. Our final model consists of a majority voted ensemble of individually trained models, and ranked 2nd out of 45 participating teams in the competition with a mean average accuracy of 0.641 and an accuracy on the first skip prediction of 0.807. Our code is released at https://github.com/Varyn/WSDM-challenge-2019-spotify.

研究の動機と目的

  • 順序的な聴取セッションにおけるユーザーのスキップ行動をモデル化することで、音楽推薦システムの改善を図ること。
  • セッションの前半のみを文脈として使用して、ユーザーがセッションの後半でスキップするトラックを予測すること。
  • 明示的なユーザープロファイルを必要とせず、時間的ダイナミクスとユーザーの好みを捉える深層学習モデルの開発。
  • 学習されたトラック埋め込みとセッション埋め込みを活用して、スキップ予測性能の向上を図ること。
  • Spotify順序的スキップ予測チャレンジにおいて最先端のパフォーマンスを達成すること。

提案手法

  • モデルは2つの異なるスタックされた長短期記憶(LSTM)ネットワークを用いる:1つはセッションの前半を処理するエンコーダーで、もう1つはセッションの後半におけるスキップを予測する予測器。
  • エンコーダーは、メタ特徴(例:ユーザーのプレミアム状態、曜日、セッション長)から導出されたセッション全体の埋め込みと、グローバルなトラック符号化で初期化される。
  • 両ネットワークは、トラック特徴(例:ビート強度、フラットネス)とトレーニング可能な埋め込み層を組み合わせた学習済みトラック埋め込みを使用する。
  • 入力シーケンスは、エンコーダーに対して前もってパディングされ、予測器に対して後ろにパディングされ、可変長のセッションに対応する。固定されたシーケンス長は10タイムステップである。
  • 異なるバッチサイズ(50〜400)で独立して訓練された5つのモデルの多数決アンサンブルを用いて、汎化性能とパフォーマンスを向上させた。
  • Adam最適化アルゴリズムを用いて訓練し、初期埋め込みサイズを固定の50、LSTM層サイズを100および500、スキップ予測用の最終全結合層サイズを500とした。

実験結果

リサーチクエスチョン

  • RQ12本のブランチを持つRNNアーキテクチャは、音楽ストリーミングセッションにおける順序的スキップ行動を効果的にモデル化できるか?
  • RQ2学習されたセッション全体の埋め込みとトラック埋め込みは、ベースライン手法と比較して、スキップ予測正解率をどの程度向上させるか?
  • RQ3異なるバッチサイズで訓練されたモデルのアンサンブル平均化は、テストセットにおける汎化性能とパフォーマンスを向上させるか?
  • RQ4セッションの前半のみを入力として使用した場合、モデルはセッションの後半におけるスキップ行動をどの程度正確に予測できるか?
  • RQ5本手法のマルチRNNアプローチは、ヒューリスティックベースラインと比較して、平均平均正解率および最初のスキップ予測正解率の観点でどの程度優れているか?

主な発見

  • 提案されたマルチRNNモデルは、テストセットで平均平均正解率0.641を達成し、Spotify順序的スキップ予測チャレンジで45チーム中2位となった。
  • 最初のスキップ予測正解率は0.807に達し、3つのベースラインすべて(特に最高のベースライン3番目:0.537の平均平均正解率)を大きく上回った。
  • 異なるバッチサイズで訓練された5つのモデルの多数決アンサンブルは、最高の単一モデル(平均平均正解率0.638)を上回るパフォーマンスを達成した。
  • 5つのアンサンブルモデルの予測間の平均相関係数は0.851であり、高い一貫性を示しており、多数決投票の正当性を裏付けた。
  • モデルのパフォーマンスは、さまざまなバッチサイズに対して安定しており、バッチサイズ300で検証正解率が最大0.638に達した。
  • TensorFlowにおけるcuDNNLSTMの使用により、1億3000万セッションのデータセットを効率的に訓練可能となり、各モデルはTitan X GPUで40〜60時間のトレーニングが行われた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。