Skip to main content
QUICK REVIEW

[論文レビュー] Combating the Cold Start User Problem in Model Based Collaborative Filtering

Sampoorna Biswas, Laks V. S. Lakshmanan|arXiv (Cornell University)|Feb 18, 2017
Recommender Systems and Techniques被引用数 10
ひとこと要約

本稿は、行列分解に基づく協調フィルタリングにおけるコールドスタートユーザーに最適なb個のアイテムを選択する最適化フレームワークを提案し、プロファイル推定誤差を最小化することを目的としている。問題を最適インタビュー設計(OID)として形式化し、目的関数のNP困難性および非部分モジュラ性を証明した。さらに、スケーラビリティに優れながらも、4つの実世界データセットにおいて先行手法と同等の推薦精度を維持する高速化された勾配ヒューリスティクスを提案した。

ABSTRACT

For tackling the well known cold-start user problem in model-based recommender systems, one approach is to recommend a few items to a cold-start user and use the feedback to learn a profile. The learned profile can then be used to make good recommendations to the cold user. In the absence of a good initial profile, the recommendations are like random probes, but if not chosen judiciously, both bad recommendations and too many recommendations may turn off a user. We formalize the cold-start user problem by asking what are the $b$ best items we should recommend to a cold-start user, in order to learn her profile most accurately, where $b$, a given budget, is typically a small number. We formalize the problem as an optimization problem and present multiple non-trivial results, including NP-hardness as well as hardness of approximation. We furthermore show that the objective function, i.e., the least square error of the learned profile w.r.t. the true user profile, is neither submodular nor supermodular, suggesting efficient approximations are unlikely to exist. Finally, we discuss several scalable heuristic approaches for identifying the $b$ best items to recommend to the user and experimentally evaluate their performance on 4 real datasets. Our experiments show that our proposed accelerated algorithms significantly outperform the prior art in runnning time, while achieving similar error in the learned user profile as well as in the rating predictions.

研究の動機と目的

  • 新しいユーザーが十分なレーティング履歴を持たないため、モデルベースの協調フィルタリングにおけるコールドスタートユーザー問題に対処すること。
  • 真のプロファイルの学習誤差を最小化するように、コールドスタートユーザーに最適なb個のアイテムを選択する問題を形式的に定義すること。
  • 行列分解に基づく協調フィルタリングにおけるプロファイル学習のための最良のb個のアイテムを選択する問題の計算複雑性を分析し、NP困難性および近似困難性を証明すること。
  • 計算コストを最小限に抑えながら高品質なプロファイル学習を達成できるスケーラブルなヒューリスティクスアルゴリズムを開発すること。
  • 提案されたアルゴリズムを実世界のデータセット上で実験的に評価し、先行手法に比べて優れたスケーラビリティと同等の精度を示すこと。

提案手法

  • コールドスタートのアイテム選択問題を、真のユーザープロファイルと学習済みプロファイルの間の二乗誤差を最小化する最適インタビュー設計(OID)という最適化問題として形式化する。
  • 選択されたb個のアイテムの潜在要因に基づいて、プロファイル誤差の閉形式表現を導出する。これにより、真のユーザーデータが存在しない状況でも目的関数の計算が可能になる。
  • Exact Cover by 3-Sets(X3C)問題への還元を用いて、OID問題がNP困難であることを証明する。これにより、計算的に困難であることが示された。
  • 目的関数が部分モジュラでも、超モジュラでもないことを示し、効率的な近似アルゴリズムが存在する可能性が低いことを示唆する。
  • 高速化された勾配ヒューリスティクス—Forward Greedy(FG)、Forward Greedy 2(FG2)、Backward Greedy(BG)、Backward Greedy 2(BG2)—を提案し、高品質なアイテム集合の探索をスケーラブルに実現する。
  • FG2およびBG2では、再計算を回避する高速近似戦略を採用することで、冗長な計算を削減し、精度を損なわずにオーダー・オブ・マグニチュードの高速化を達成した。

実験結果

リサーチクエスチョン

  • RQ1真のユーザープロファイルの学習誤差を最小化するように、コールドスタートユーザーに推薦する最適なb個のアイテムは何か?
  • RQ2行列分解に基づく協調フィルタリングにおけるプロファイル学習のための最良のb個のアイテムを選択する問題の計算複雑性はどの程度か?
  • RQ3プロファイル誤差の目的関数は部分モジュラまたは超モジュラか?この性質は近似アルゴリズムにどのような意味を持つのか?
  • RQ4計算コストを著しく低減しつつ、高品質なプロファイル学習を達成できるスケーラブルなヒューリスティクスアルゴリズムを設計できるか?
  • RQ5提案されたアルゴリズムは、大規模な実世界のデータセットにおいて、プロファイル誤差、予測誤差、実行時間の観点でどの程度の性能を示すか?

主な発見

  • 最適インタビュー設計(OID)問題はNP困難であり、かつα/θの要因内で近似が困難であることが示された。これは、効率的な正確または近似解が得られにくいことを示唆する。
  • 目的関数(真のプロファイルと学習済みプロファイルの二乗誤差)は部分モジュラでも超モジュラでもない。これは、標準的な近似手法が効果を発揮しない可能性が高いことを示唆する。
  • 高速化された勾配ヒューリスティクスであるFG2およびBG2は、ML-100K、ML-1M、Netflix、ML-20Mの実験で、非高速化された手法と同等のプロファイル誤差および予測誤差を達成した。
  • 理想的な条件下でML-100Kにおいてb=100の場合、FG2はABG2の実行時間の1/6未満にまで短縮された。これは、スケーラビリティの顕著な向上を示している。
  • bが小さい場合、バックワード勾配ヒューリスティクス(BGおよびBG2)は実行時間が急激に増加するため、通常bが小さい実世界のシステムでは実用的でない。
  • すべてのデータセットにおいて、FG2は実行時間ですべてのベースラインを上回り、プロファイル誤差および予測誤差の観点でも同等または優れた性能を示した。これにより、FG2が最も効果的なヒューリスティクスであると結論づけられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。