Skip to main content
QUICK REVIEW

[論文レビュー] Using offline metrics and user behavior analysis to combine multiple systems for music recommendation

Andrés Ferraro, Dmitry Bogdanov|arXiv (Cornell University)|Jan 8, 2019
Recommender Systems and Techniques参考文献 22被引用数 8
ひとこと要約

本論文は、ユーザー行動特徴量に基づいて各システムの期待性能を予測する回帰モデルを用いて、協調フィルタリング(行列分解)と人気ベースのシステムを統合するパーソナライズドな融合手法を提案する。このアプローチは、nDCG@500と多様性の向上を実証した目的の指標に最適化され、実世界のMelonストリーミングデータを用いた実験で、複数の指標においてベースラインを上回る性能を示した。

ABSTRACT

There are many offline metrics that can be used as a reference for evaluation and optimization of the performance of recommender systems. Hybrid recommendation approaches are commonly used to improve some of those metrics by combining different systems. In this work we focus on music recommendation and propose a new way to improve recommendations, with respect to a desired metric of choice, by combining multiple systems for each user individually based on their expected performance. Essentially, our approach consists in predicting an expected error that each system will produce for each user based on their previous activity. To this end, we propose to train regression models for different metrics predicting the performance of each system based on a number of features characterizing previous user behavior in the system. We then use different fusion strategies to combine recommendations generated by each system. Following this approach one can optimize the final hybrid system with respect to the desired metric of choice. As a proof of concept, we conduct experiments combining two recommendation systems, a Matrix Factorization model and a popularity-based recommender. We use the data provided by Melon, a Korean music streaming service, to train and evaluate the performance of the systems.

研究の動機と目的

  • 音楽推薦システムにおける固定指標最適化の限界を克服し、動的でユーザーに特化したシステムの組み合わせを可能にすること。
  • 行列分解や人気ベースのシステムなど複数のシステムを、ユーザーごとの性能予測に基づいて統合することで推薦品質を向上させること。
  • MAP や RMSE のような単一の指標に依存せず、多様性やランク付け品質を含む広範なオフライン指標のセットを用いてハイブリッドシステムを評価すること。
  • ユーザー行動パターンが、個々のユーザーに対して協調フィルタリングと人気ベースのシステムのどちらがより良い性能を示すかを信頼性を持って予測できるかを調査すること。
  • 行動特徴量に基づく回帰による融合重み最適化が、nDCG@500 などのターゲット指標において優れた性能を発揮することを実証すること。

提案手法

  • ユーザー行動特徴量から得られる情報(例:SVD による暗黙的フィードバック、人気ベース)を用いて、各コンポーネントシステムの期待誤差(または性能)を予測する回帰モデルをユーザーごとに訓練する。
  • 繰り返し再生されたアーティストの割合、セッションベースの聴取パターン、グローバルな聴取統計などの特徴量を、回帰モデルの入力としてのユーザー行動表現に用いる。
  • 特に、ユーザーごとに学習された重みを用いたランク統合(rank fusion)を用いるパーソナライズドな統合戦略を適用し、各システムの重みはその性能の予測値によって決定される。
  • 回帰モデルの学習において、目的の指標(例:nDCG@500)をターゲットとして設定することで、統合プロセスを最適化する。
  • 200K人のユーザーと2億1100万件のイベントを含む大規模なMelonデータセットを用いてシステムを訓練・評価し、複数のオフライン指標を用いて検証する。
  • FUSE や SELECT などの統合戦略を比較し、精度、多様性、正規化された割合付き累積利得(nDCG)などの指標で性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1ユーザー行動特徴量は、個々のユーザーに対して行列分解と人気ベースのシステムのどちらがより良い性能を示すかを信頼性を持って予測できるか?
  • RQ2性能予測に基づいて複数のシステムを統合することは、単一のシステムを用いる場合と比較して、ランク付け品質が向上するか?
  • RQ3nDCG@500 などの特定の指標に最適化された統合戦略は、多様性 や 精度 などの他の指標においても改善を維持できるか?
  • RQ4行動パターンに基づく融合重みのパーソナライズが、固定またはグローバルな統合と比較して、全体の推薦品質にどのように影響するか?
  • RQ5セッションレベルの行動特徴量は、グローバル特徴量と比較して、システム性能予測においてどの程度優れているか?

主な発見

  • nDCG@500 に最適化されたハイブリッドシステムは、評価指標の大部分でベースラインを上回る最も優れた全体的な性能を達成した。
  • FUSE-nDCG@500 統合戦略は、500件での正規化された割合付き累積利得が 0.780 に達し、人気ベースのベースライン(0.754)とSVDベースライン(0.744)を顕著に上回った。
  • 回帰ベースの重み付けによるパーソナライズド統合は、多様性の向上を示し、人気ベースのベースラインと比較して平均nDCG@10が12.57%向上した。
  • SELECT-nDCG@10 指標において、人気ベースのベースラインに対して2500倍の向上を達成し、短いリスト推薦における優れた性能を示した。
  • 特にセッション内での繰り返し再生アーティストの割合といったセッションベースの特徴量が、グローバル特徴量よりも性能推定においてより予測能が高かった。
  • 行動パターンに基づく回帰モデルは、システム性能を効果的に予測でき、ユーザーごとのシステム選択と統合を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。