Skip to main content
QUICK REVIEW

[論文レビュー] Toward Word Embedding for Personalized Information Retrieval

Nawal Ould-Amer, Philippe Mulhem|arXiv (Cornell University)|Jun 22, 2016
Topic Modeling参考文献 7被引用数 4
ひとこと要約

本稿では、ソーシャルブックサーチの文脈において、ユーザープロフィールから学習されたword2vec埋め込みを用いたパーソナライズドクエリ拡張を検討している。非パーソナライズド埋め込みはわずかにパーソナライズド埋め込みを上回るが、結果は語の埋め込みが検索効果を向上させないことを示しており、ノイズの多いクエリと不足したユーザープロフィールデータのため、word2vecをスパースなユーザーコンテンツを伴うパーソナライズドIRに適用する際の限界を示唆している。

ABSTRACT

This paper presents preliminary works on using Word Embedding (word2vec) for query expansion in the context of Personalized Information Retrieval. Traditionally, word embeddings are learned on a general corpus, like Wikipedia. In this work we try to personalize the word embeddings learning, by achieving the learning on the user's profile. The word embeddings are then in the same context than the user interests. Our proposal is evaluated on the CLEF Social Book Search 2016 collection. The results obtained show that some efforts should be made in the way to apply Word Embedding in the context of Personalized Information Retrieval.

研究の動機と目的

  • 語の埋め込みがソーシャルブックサーチにおけるパーソナライズド情報検索を向上させられるかどうかを評価すること。
  • 一般コーパスからの学習と比較して、ユーザープロフィールから語の埋め込みを学習することで、クエリ拡張が向上するかどうかを調査すること。
  • クエリフィルタリングが埋め込みベースの拡張効果に与える影響を評価すること。
  • スパースなユーザーデータを伴うword2vecをパーソナライズドIRに適用する際の課題を特定すること。

提案手法

  • ユーザープロフィールは、その本のカタログ、タグ、レーティングからなる文書を連結することでモデル化される。
  • クエリフィルタリングは、ストップワードリストとポーターのステママーを用いて、形容詞と標準的なストップワードを除去する。
  • 各フィルタリング済みクエリ語に対して、word2vec空間におけるコサイン類似度を用いて上位-k個の意味的に類似した語が選択される。
  • パーソナライズド埋め込みはユーザーデータ固有のプロフィール上で学習される一方、非パーソナライズド埋め込みは全コレクション上で学習される。
  • クエリ拡張は、元の語と上位-k語の埋め込みを組み合わせ、検索には標準的なランク付けモデルが用いられる。
  • 評価にはCLEF Social Book Search 2016データセットを用い、MAP、MRR、P@10が使用される。

実験結果

リサーチクエスチョン

  • RQ1語の埋め込みは、ソーシャルブックサーチにおけるクエリ拡張に効果的に使用できるか?
  • RQ2ユーザープロフィールを用いて語の埋め込みをパーソナライズすることで、検索パフォーマンスが向上するか?
  • RQ3クエリフィルタリングは、埋め込みベースのクエリ拡張の効果にどのように影響するか?
  • RQ4この文脈において、なぜパーソナライズド埋め込みが非パーソナライズド埋め込みよりもパフォーマンスが低いのか?

主な発見

  • クエリフィルタリングによりMAPは0.0266から0.0309に向上したが、P@10は低下した。これは、効果が混合的であることを示している。
  • 非パーソナライズドクエリ拡張は、特に上位2語を超えた拡張において、ほとんどの設定でパーソナライズド拡張を上回った。
  • パーソナライズド埋め込みは顕著な向上を示さず、上位2語を超えた拡張では性能が著しく低下し、MAP曲線は平坦だった。
  • 最もパフォーマンスの高かった設定は、フィルタリング済みで拡張なしのクエリ(Conf 2)であり、すべての拡張バージョンを上回った。
  • パーソナライズドおよび非パーソナライズド両方の拡張が、ベースラインを上回らなかった。これは、埋め込みの品質とデータスパarsityに根本的な問題があることを示唆している。
  • 本研究では、パフォーマンスの悪さは、低品質なユーザープロフィールと、個々のユーザーユーザーに対して有効なword2vec学習を行うのに十分でないデータ量に起因するとされる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。