Skip to main content
QUICK REVIEW

[論文レビュー] Temporal Matrix Factorization for Tracking Concept Drift in Individual User Preferences

Yung-Yin Lo, Wanjiun Liao|arXiv (Cornell University)|Oct 18, 2015
Recommender Systems and Techniques参考文献 29被引用数 4
ひとこと要約

本稿では、時間変動するユーザーの潜在的ベクトルを、修正された確率的勾配降下法を用いて学習し、Lasso回帰を用いて遷移をモデル化することで、個々のユーザーの好みの変化(コンセプトドリフト)を追跡する新規手法である時系列行列分解(TMF)を提案する。TMFは、合成データでは最大26%、Ciaoデータセットでは5%のRMSE低減を達成しており、これは実際の好みの変化を示すユーザーに対して顕著である。

ABSTRACT

The matrix factorization (MF) technique has been widely adopted for solving the rating prediction problem in recommender systems. The MF technique utilizes the latent factor model to obtain static user preferences (user latent vectors) and item characteristics (item latent vectors) based on historical rating data. However, in the real world user preferences are not static but full of dynamics. Though there are several previous works that addressed this time varying issue of user preferences, it seems (to the best of our knowledge) that none of them is specifically designed for tracking concept drift in individual user preferences. Motivated by this, we develop a Temporal Matrix Factorization approach (TMF) for tracking concept drift in each individual user latent vector. There are two key innovative steps in our approach: (i) we develop a modified stochastic gradient descent method to learn an individual user latent vector at each time step, and (ii) by the Lasso regression we learn a linear model for the transition of the individual user latent vectors. We test our method on a synthetic dataset and several real datasets. In comparison with the original MF, our experimental results show that our temporal method is able to achieve lower root mean square errors (RMSE) for both the synthetic and real datasets. One interesting finding is that the performance gain in RMSE is mostly from those users who indeed have concept drift in their user latent vectors at the time of prediction. In particular, for the synthetic dataset and the Ciao dataset, there are quite a few users with that property and the performance gains for these two datasets are roughly 20% and 5%, respectively.

研究の動機と目的

  • 推薦システムにおける静的行列分解の限界、すなわち時間的変化するユーザー好みを捉えられないことに対処すること。
  • 特にコンセプトドリフトを考慮した、個々のユーザー好みの時間的変化をモデル化する整合的な手法の開発。
  • スパースで動的な環境において、各時刻でユーザー潜在要因を適応的に更新することで、レーティング予測誤差を低減すること。
  • 実際に好みの変化を示すユーザーに限定して計算リソースを集中させることで、効率性を向上させること。
  • 多数のハイパーパrameterチューニングを要する従来の動的MF手法に対する構造的で代替可能な手法の提供。

提案手法

  • 各時刻で個々のユーザー潜在ベクトルを学習するために、修正された確率的勾配降下法(SGD)が用いられ、グローバルおよび時刻特有のレーティングデータを統合することで、データスパarsityの影響を軽減する。
  • 各ユーザーの潜在ベクトルの時間的線形遷移をモデル化するためにLasso回帰が適用され、スパースで解釈可能な遷移パターンを可能にする。
  • ユーザーおよびアイテムの潜在要因を同時に最適化しながら、各時刻ウィンドウごとにユーザーベクトルを動的に更新することで、時間的ダイナミクスを保持する。
  • 遷移モデルはユーザーごとに学習されるため、均一な遷移行動を仮定しない個別化されたコンセプトドリフトの追跡が可能である。
  • このアプローチは行列分解フレームワークに統合されており、標準MFに時間的適応性を追加しながらも、スケーラビリティを維持する。
  • 実行時間解析により、MATLABで実装した場合、標準MFと同等の追加オーバーヘッドであることが確認された。

実験結果

リサーチクエスチョン

  • RQ1動的行列分解アプローチは、個々のユーザーの好みの変化(コンセプトドリフト)を、時間経過とともに効果的に追跡できるか?
  • RQ2TMFの性能は、合成データおよび実世界データにおいて、静的行列分解と比較してRMSEの観点でどのように異なるか?
  • RQ3性能向上の度合いは、実際にユーザーの好みの変化が生じているかどうかとどの程度相関しているか?
  • RQ4本手法は、実際にコンセプトドリフトを経験しているユーザーを効率的に特定し、予測精度の向上に集中できるか?
  • RQ5特にレーティング数が少ないユーザーに対して、個々の時刻でのデータスパarsityをどのように処理しているか?

主な発見

  • 合成データセットにおいて、TMFは標準行列分解と比較してRMSEを17–26%相対的に改善した。
  • Ciaoデータセットでは、TMFがRMSEを約5%低減し、性能向上は実際に好みの変化を示すユーザーに集中している。
  • RMSEの大部分の改善は、実際の好みの変化を示すユーザーに起因しており、本手法が動的ユーザーに的確に焦点を当てていることを示している。
  • アイデンティティ遷移行列(ドリフトなし)を持つユーザーは、性能向上にほとんど寄与していないため、このようなユーザーをフィルタリングすることで手法の最適化が可能である。
  • 計算上の実行可能性が維持されており、MATLABで実装した場合、標準MFと同等の実行時間オーバーヘッドを示している。
  • コールドスタートユーザーのレーティングは、アイテムの潜在要因推定に有意に寄与しており、他のユーザーの予測精度向上に役立つことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。