Skip to main content
QUICK REVIEW

[論文レビュー] Deep Heterogeneous Autoencoders for Collaborative Filtering

Tianyu Li, Yukun Ma|arXiv (Cornell University)|Dec 17, 2018
Recommender Systems and Techniques参考文献 15被引用数 6
ひとこと要約

本稿では、共同フィルタリングのためのデュアルハイブリッド自己符号化器(DHA)を提案する。DHAは、ユーザーのプロフィールやアイテムのタグといった静的データに対してスタックドノイズ除去自己符号化器(SDAE)を、ユーザーの購入履歴のような順序データに対してLSTMを用いたRNNエンコーダデコーダ(RNNED)を活用し、進化するユーザーの好みをモデル化する。本モデルは、eコマースおよびMovieLensデータセットで平均平均精度(MAP)とリCALLを最大36.7%向上させ、異種のデータソースから共通の潜在表現を共同で学習することで、最先端の性能を達成した。

ABSTRACT

This paper leverages heterogeneous auxiliary information to address the data sparsity problem of recommender systems. We propose a model that learns a shared feature space from heterogeneous data, such as item descriptions, product tags and online purchase history, to obtain better predictions. Our model consists of autoencoders, not only for numerical and categorical data, but also for sequential data, which enables capturing user tastes, item characteristics and the recent dynamics of user preference. We learn the autoencoder architecture for each data source independently in order to better model their statistical properties. Our evaluation on two MovieLens datasets and an e-commerce dataset shows that mean average precision and recall improve over state-of-the-art methods.

研究の動機と目的

  • ユーザーのプロフィール、アイテムの説明、タグ、順序付き購入履歴などの異種の補助情報(例:ユーザーの属性、アイテムのタグ)を統合することで、共同フィルタリングにおけるデータスパarsity問題を緩和すること。
  • 統一された表現フレームワークを用いて、静的ユーザーおよびアイテム特徴と、時間経過に伴うユーザー好みの動的変化を同時にモデル化すること。
  • 異なるデータタイプから共有潜在特徴を独立して学習することで、多様なデータタイプからの高品質な特徴抽出を実現し、推薦精度を向上させること。
  • 最近のユーザー行動の順序モデリングが、単なる静的補助情報に比べて、推薦性能を顕著に向上させることを示すこと。

提案手法

  • 本モデルは、ユーザーの属性やアイテムのタグのような数値的・カテゴリカルなデータから、低次元でロバストな表現を学習するためにスタックドノイズ除去自己符号化器(SDAE)を用いる。
  • 順序データ(例:ユーザーの購入履歴)に対しては、長期短期記憶(LSTM)ユニットを搭載した再帰的ニューラルネットワークエンコーダデコーダ(RNNED)を採用し、時間的ダイナミクスと進化するユーザー関心を捉える。
  • 各データソースは、その統計的性質に適合した自己符号化器アーキテクチャを独立して使用し、各ソースごとに異なる隠れ層数やユニット数を設定可能である。
  • 各データソースからの局所的表現が、ユーザー・アイテム相互作用と共同フィルタリング信号を同時にモデル化する共通の潜在空間に統合される。
  • 最終的なユーザー・アイテム相互作用行列は、学習済みのユーザーおよびアイテムの潜在要因行列のドット積によって近似され、グリッドサーチで最適化されたハイパーパrameterを用いた確率的勾配降下法で学習される。
  • 表現学習と共同フィルタリング最適化の間を交互に繰り返す。各特徴抽出ステップで3回のエポックの交互学習と3回の訓練エポックを実施する。

実験結果

リサーチクエスチョン

  • RQ1ユーザーのプロフィール、アイテムの説明、順序付き購入履歴といった異種の補助データを統合することで、スパースなデータ環境下での共同フィルタリング性能が向上するか?
  • RQ2RNNベースのエンコーダーを用いた順序付きユーザー行動のモデリングは、単に静的特徴をモデル化するのと比較して、動的ユーザー好みの捉え方を改善するか?
  • RQ3各データソースに特化した独立した自己符号化器アーキテクチャが、表現品質および下流の推薦精度に与える影響は何か?
  • RQ4最近のユーザー購入シーケンスは、現在のユーザー関心をどれほど正確に反映しており、オフライン製品推薦の性能向上に寄与するか?

主な発見

  • オフラインペイeコマースデータセットでは、DHA-allはd=50でMAP@100が0.0424を達成し、ベースラインのimplicit-cfモデル(0.0155)と比較して42.4%の改善を示した。
  • DHA-RNNED-s5(5ステップの購入履歴)はd=150でMAP@100が0.0367を記録し、DHA-RNNED-s10(0.0339)を上回った。これは、より最近の購入履歴が現在の好みをより的確に示しているという仮説を裏付けた。
  • DHA-RNNED-item(オンライン購入履歴とアイテムジャンル説明のみをモデル化)はd=50でMAP@100が0.0394を達成し、CDL(0.0296)およびDCF(0.0237)を上回った。これは、ユーザー登録データがなくても、順序データの価値が顕著であることを示している。
  • DHA-allモデル(すべてのデータソースを統合)は、全設定の中で最高のMAPとリCALLを達成し、静的および順序データの統合が有効であることを示した。
  • より多くの補助情報を使用しているにもかかわらず、DCFはCDLを下回った。これは、ノイズが多いか古くなったユーザー登録データが性能を劣化させる可能性があることを示しており、データ品質と関連性の重要性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。