Skip to main content
QUICK REVIEW

[論文レビュー] A multinomial probabilistic model for movie genre predictions

Eric Makita, Artem Lenskiy|arXiv (Cornell University)|Mar 25, 2016
Recommender Systems and Techniques参考文献 7被引用数 3
ひとこと要約

本稿では、ユーザー評価から映画のジャンルを予測するための多項確率的モデルを提案し、ジャンル予測を分類問題として扱う。わずかに15%のMovieLensデータセットを訓練データとして使用した場合でも70%のジャンル予測率を達成しており、ユーザー評価のパターンだけでも、小規模な訓練データからも高い正確性で映画のジャンルを効果的に推定できることが示された。

ABSTRACT

This paper proposes a movie genre-prediction based on multinomial probability model. To the best of our knowledge, this problem has not been addressed yet in the field of recommender system. The prediction of a movie genre has many practical applications including complementing the items categories given by experts and providing a surprise effect in the recommendations given to a user. We employ mulitnomial event model to estimate a likelihood of a movie given genre and the Bayes rule to evaluate the posterior probability of a genre given a movie. Experiments with the MovieLens dataset validate our approach. We achieved 70% prediction rate using only 15% of the whole set for training.

研究の動機と目的

  • 専門家がラベル付けしたカテゴリ以外のアイテムジャンルを予測しない推薦システムのギャップを埋めるため。
  • 多様性、新規性、偶然性を支援するジャンル予測を可能にすることで、推薦品質を向上させるため。
  • メタデータに依存せずに、ユーザー評価のパターンだけでも映画ジャンルを信頼性高く予測できるかを検証するため。
  • 実世界のユーザー評価データを用いて、多項確率的モデルのジャンル予測における有効性を検証するため。

提案手法

  • モデルは、ユーザー評価パターンに基づいて、ジャンルが与えられたもとでの映画の尤度を推定する多項イベントモデルを用いる。
  • ベイズ推論を用いて、映画の評価プロファイルが与えられたもとでのジャンルの事後確率を計算する。
  • 条件付き独立性を仮定するNaive Bayes分類器を採用し、ユーザー間での評価値が条件付き独立であるとみなす。
  • 事前確率はデータセット内のジャンルの頻度から推定され、条件付き確率は各ジャンルごとの評価分布から導出される。
  • 予測は評価値ごと(1から5)に実施され、複数の真のジャンルが割り当てられている場合、いずれかと一致すれば成功とみなす。
  • 数値のアンダーフローを防ぎ、計算の安定性を向上させるために対数確率が使用される。

実験結果

リサーチクエスチョン

  • RQ1ユーザー評価のパターンだけでも、高い正確性で映画ジャンルを予測できるか?
  • RQ2訓練データのサイズが多項モデルのジャンル予測性能にどのように影響するか?
  • RQ3特定の評価レベル(例:中立的、やや肯定的)では、他の評価レベルよりもモデルの性能が優れているか?
  • RQ4予期しないが関連性のあるジャンルを同定することで、モデルが推薦の多様性を向上させられるか?

主な発見

  • モデルは、MovieLensデータセットのわずか15%のデータで訓練された場合、70%のジャンル予測率を達成した。
  • 訓練データに5%のデータを使用した場合でも、62%の予測率を達成しており、ランダムな推測(30%の正確性)を著しく上回った。
  • 訓練データが大きくなるほど予測正確性は向上するが、初期の5%のデータを超えると向上の割合は鈍くなる。
  • 最も高い予測正確性は、評価値3(中立的)および4(やや好き)のとき観察され、これらはデータセット内で最も頻出する評価カテゴリである。
  • 最も低い予測正確性は、評価値1(強く嫌い)および2(やや嫌い)のとき観察され、これはデータ頻度が低く、曖昧さが高いためと推察される。
  • モデルは、最小限の訓練データでも、ユーザー評価プロファイルにのみ依存しても、映画ジャンルを効果的に推定できる十分な情報が含まれていることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。