Skip to main content
QUICK REVIEW

[論文レビュー] Collectively Embedding Multi-Relational Data for Predicting User Preferences

Nitish Gupta, Sameer Singh|arXiv (Cornell University)|Apr 23, 2015
Recommender Systems and Techniques参考文献 26被引用数 6
ひとこと要約

本稿では、ユーザー、アイテム、関係データ(例:レビュー、カテゴリ、属性)を統合的に、共有の低次元空間に埋め込むことで、ユーザーの好みの予測を向上させる集合的行列分解モデルを提案する。複数の関係にまたがる共有埋め込みを学習することにより、異種で不完全かつノイズの多い証拠を効果的に統合し、アマゾンおよびユープルのデータセットにおいて、レーティング予測の精度を著しく向上させるとともに、強力なコールドスタート性能を発揮し、欠損データの同時可視化と補完を可能にする。

ABSTRACT

Matrix factorization has found incredible success and widespread application as a collaborative filtering based approach to recommendations. Unfortunately, incorporating additional sources of evidence, especially ones that are incomplete and noisy, is quite difficult to achieve in such models, however, is often crucial for obtaining further gains in accuracy. For example, additional information about businesses from reviews, categories, and attributes should be leveraged for predicting user preferences, even though this information is often inaccurate and partially-observed. Instead of creating customized methods that are specific to each type of evidences, in this paper we present a generic approach to factorization of relational data that collectively models all the relations in the database. By learning a set of embeddings that are shared across all the relations, the model is able to incorporate observed information from all the relations, while also predicting all the relations of interest. Our evaluation on multiple Amazon and Yelp datasets demonstrates effective utilization of additional information for held-out preference prediction, but further, we present accurate models even for the cold-starting businesses and products for which we do not observe any ratings or reviews. We also illustrate the capability of the model in imputing missing information and jointly visualizing words, categories, and attribute factors.

研究の動機と目的

  • 推薦システムにおいて、不完全でノイズが多く、異種の関係データを扱う伝統的な行列分解の限界を克服すること。
  • 各データタイプごとにカスタムモデルを必要とせず、複数の関係(例:レーティング、レビュー、カテゴリ、属性)を統合的にモデル化できる汎用的かつドメインに依存しない手法を開発すること。
  • 観測されたレーティングが少なく、あるいは全くないユーザーおよびアイテムの予測精度を向上させること、特にコールドスタート状況での性能向上を図ること。
  • 異なるエンティティタイプ(例:語、カテゴリ、属性)を、共有の埋め込み空間内で意味的に整合した形で同時に推論・可視化すること。
  • すべての関係にわたる共有埋め込みを活用して、関係データの欠損値を補完することを可能にすること。

提案手法

  • モデルは、複数の関係にまたがるすべてのエンティティ(ユーザー、アイテム、語、カテゴリ、属性)の共有低次元埋め込みを、集合的行列分解を用いて学習する。
  • 各関係の予測は、関連するエンティティの埋め込み同士の内積を用いたロジスティック/シグモイド関数として定式化される。
  • スケーラビリティを確保するため、モデルパラメータの最適化に確率的勾配降下法(SGD)が用いられる。
  • モデルは二項関係にとどまらず、多値属性を複数の二項関係としてモデル化し、テンソル因子分解を用いてn項関係をサポートする。
  • エンティティ間の類似度は、直接的な関係が存在しないエンティティに対しても、共有埋め込み空間上で直接計算可能である。
  • 新しいデータタイプの統合は、データベースに新しい関係を追加するだけで可能であり、モデル全体の再学習を必要としない。

実験結果

リサーチクエスチョン

  • RQ1統一されたモデルが、多様で不完全かつノイズの多い関係データを統合的に学習することで、伝統的な行列分解をはるかに超えるユーザーの好みの予測を可能にするか?
  • RQ2観測されたレーティングやレビューが全くない新規またはコールドスタートのアイテムに対して、モデルの予測性能はどの程度高いか?
  • RQ3属性やカテゴリなどの関係データにおける欠損値を、すべての関係にわたる共有埋め込みを活用してどの程度正確に補完できるか?
  • RQ4学習された埋め込みが、語、カテゴリ、属性といった意味的に異なるエンティティタイプを、意味的に整合した形で共有の2次元埋め込み空間に可視化できるか?
  • RQ5アマゾンおよびユープルの実世界の多関係データセットのような大規模なデータセットにおいて、モデルの性能はどのようにスケーリングするか?

主な発見

  • 集合的因子分解モデルは、レビュー、カテゴリ、属性といった追加の関係的証拠を効果的に活用することで、ユーザーの好みの予測において顕著な精度向上を達成する。
  • モデルはコールドスタート状況においても優れた性能を示し、観測されたレーティングやレビューが全くない新規の店舗や製品に対しても、正確にレーティングを予測できる。
  • すべての関係にわたる共有埋め込みを活用することで、観測されていない属性やカテゴリなどの関係データの欠損値を効果的に補完する。
  • 共有の2次元埋め込み空間上でカテゴリ、属性、レビュー語を同時に可視化することで、元のデータに存在しない意味的なクラスターや暗黙の関係が明確に可視化される。
  • モデルは大規模な実世界のデータセットにも効果的にスケーリングでき、アマゾンおよびユープルの26の多関係データセットにおいて、安定した性能を発揮する。
  • テンソル因子分解と関係固有の潜在要因を用いることで、n項関係および多値関係への拡張性が自然に実現され、複雑なデータベーススキーマのモデル化が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。