Skip to main content
QUICK REVIEW

[論文レビュー] Towards Evaluating User Profiling Methods Based on Explicit Ratings on Item Features

Luca Luciano Costanzo, Yashar Deldjoo|arXiv (Cornell University)|Aug 29, 2019
Recommender Systems and Techniques参考文献 23被引用数 4
ひとこと要約

本論文は、映画の特徴(ジャンル、俳優、監督)に関する明示的ユーザー評価と暗黙的ユーザー特徴抽出手法を比較し、推定されたユーザー好みと実際の好みの間で類似度が低いことを明らかにした。著者らは公開可能なデータセットを構築し、最良の手法でもジャンルに関しては平均58.07%のコサイン類似度にとどまることを確認した。これは、レコメンデーションシステムにおけるユーザープロファイルモデリングの改善余地が依然として大きいことを示している。

ABSTRACT

In order to improve the accuracy of recommendations, many recommender systems nowadays use side information beyond the user rating matrix, such as item content. These systems build user profiles as estimates of users' interest on content (e.g., movie genre, director or cast) and then evaluate the performance of the recommender system as a whole e.g., by their ability to recommend relevant and novel items to the target user. The user profile modelling stage, which is a key stage in content-driven RS is barely properly evaluated due to the lack of publicly available datasets that contain user preferences on content features of items. To raise awareness of this fact, we investigate differences between explicit user preferences and implicit user profiles. We create a dataset of explicit preferences towards content features of movies, which we release publicly. We then compare the collected explicit user feature preferences and implicit user profiles built via state-of-the-art user profiling models. Our results show a maximum average pairwise cosine similarity of 58.07\% between the explicit feature preferences and the implicit user profiles modelled by the best investigated profiling method and considering movies' genres only. For actors and directors, this maximum similarity is only 9.13\% and 17.24\%, respectively. This low similarity between explicit and implicit preference models encourages a more in-depth study to investigate and improve this important user profile modelling step, which will eventually translate into better recommendations.

研究の動機と目的

  • アイテムの特徴(例:ジャンル、俳優)に関する明示的ユーザー評価と、映画評価から導かれる暗黙的ユーザー特徴の間の乖離を調査すること。
  • 最先端のユーザー特徴抽出手法が、アイテム特徴における真のユーザー好みをどれだけ正確に再構築できるかを評価すること。
  • 評価の目的で利用可能な、アイテムコンテンツ特徴に関する明示的ユーザー好みを含む公開データセットの不足を是正すること。
  • コンテンツベースおよびハイブリッドレコメンデーションシステムにおけるユーザー特徴抽出段階の評価における顕著なギャップを浮き彫りにすること。
  • 全体のレコメンデーション精度を向上させるために、ユーザープロファイルモデリングの改善に向けたより深い研究を促すこと。

提案手法

  • クラウドソーシングを活用したウェブアプリケーションを通じて、映画の特徴(ジャンル、俳優、監督)に関する明示的ユーザー評価を収集し、公開可能なデータセットを構築した。
  • ユーザーの回答に基づき、評価された特徴には重み1、それ以外には0を割り当てるバイナリーベクトルとして、明示的ユーザー特徴を構築した。
  • 映画評価データを用いて、最先端の4つのユーザー特徴抽出手法(Zhang、Li、Symeonidis、TF-IDF)を適用し、暗黙的ユーザー特徴を生成した。
  • コサイン類似度およびジャカード類似度の指標を用いて、明示的特徴と暗黙的特徴の間の類似度を測定した。
  • ジャンル(19カテゴリ)、俳優(567K)、監督(58K)の3種類の特徴タイプを対象とし、特徴の集合の大きさ(基数)が異なる状況での類似度を評価した。
  • スカラ重みを扱うために、各ユーザーごとに最も関連性の高い特徴を特定するkトップ特徴選択をジャカード類似度の計算に適用した。

実験結果

リサーチクエスチョン

  • RQ1最先端の手法によって生成された暗黙的ユーザー特徴は、アイテム特徴に関する明示的ユーザー好みとどの程度類似しているか?
  • RQ2特徴タイプ(例:ジャンル対俳優)が、明示的および暗黙的ユーザー特徴の類似度に与える影響は何か?
  • RQ3特徴集合の基数(例:19のジャンル対567Kの俳優)が、ユーザー特徴抽出手法の性能に与える影響は何か?
  • RQ4既存のユーザー特徴抽出手法は、明示的評価によって表現された真のユーザーの好みをどの程度正確に再構築できるか?
  • RQ5明示的および暗黙的特徴の類似度が低いのは、ユーザー評価のノイズに起因するのか、それともモデリング手法の限界に起因するのか?

主な発見

  • 最も性能の良いユーザー特徴抽出手法(Li)でも、ジャンルに関しては暗黙的特徴と明示的ユーザー好みの間で平均58.07%のコサイン類似度にとどまっている。
  • 俳優に関しては、全手法の平均コサイン類似度の最大値がたったの9.13%にとどまり、暗黙的モデルと明示的好みの間で整合性が乏しいことが示された。
  • 監督に関しては、最高の平均コサイン類似度が17.24%にとどまり、依然として著しく低い水準であり、ユーザー好みのモデリングが弱いことが示唆された。
  • ジャカード類似度の結果は、コサイン類似度よりも常に低く、最も良い手法でジャンルでは36.19%、俳優ではたった5.73%にとどまった。
  • 全特徴タイプにわたり類似度が低いことから、現在の暗黙的ユーザー特徴抽出手法が真のユーザー好みを捉える能力に限界があることが明らかになった。
  • これらの結果は、誤ったユーザー特徴モデリングがレコメンデーション精度の主要なボトル neck である可能性を示唆しており、より良い特徴抽出手法の開発に向けたさらなる研究が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。