Skip to main content
QUICK REVIEW

[論文レビュー] Know Your Personalization: Learning Topic level Personalization in Online Services

Anirban Majumder, Nisheeth Shrivastava|arXiv (Cornell University)|Dec 14, 2012
Recommender Systems and Techniques参考文献 22被引用数 6
ひとこと要約

本稿では、検索結果などのコンテンツ出力におけるパーソナライズ済みとノーマルな出力の差を分析することで、オンラインサービスにおけるユーザーのパーソナライゼーションプロファイルをブラックボックス手法で推定する方法を提案している。Latent Topic Personalization (LTP) モデルを用いて、実際の Google 検索データから 84% の R-precision を達成し、ユーザーが隠れたプロファイル情報を発見できるようになり、プライバシー評価フレームワークの支援も可能となる。

ABSTRACT

Online service platforms (OSPs), such as search engines, news-websites, ad-providers, etc., serve highly pe rsonalized content to the user, based on the profile extracted from his history with the OSP. Although personalization (generally) leads to a better user experience, it also raises privacy concerns for the user---he does not know what is present in his profile and more importantly, what is being used to per sonalize content for him. In this paper, we capture OSP's personalization for an user in a new data structure called the person alization vector ($η$), which is a weighted vector over a set of topics, and present techniques to compute it for users of an OSP. Our approach treats OSPs as black-boxes, and extracts $η$ by mining only their output, specifical ly, the personalized (for an user) and vanilla (without any user information) contents served, and the differences in these content. We formulate a new model called Latent Topic Personalization (LTP) that captures the personalization vector into a learning framework and present efficient inference algorithms for it. We do extensive experiments for search result personalization using both data from real Google users and synthetic datasets. Our results show high accuracy (R-pre = 84%) of LTP in finding personalized topics. For Google data, our qualitative results show how LTP can also identifies evidences---queries for results on a topic with high $η$ value were re-ranked. Finally, we show how our approach can be used to build a new Privacy evaluation framework focused at end-user privacy on commercial OSPs.

研究の動機と目的

  • 検索エンジンやレコメンドシステムなどのオンラインサービスプラットフォーム(OSP)が保持する隠れたパーソナライゼーションプロファイルを、エンドユーザーが発見できるようにすること。
  • 内部アルゴリズムやユーザー履歴にアクセスできない状況でも、OSP をブラックボックスとして扱い、ユーザーの関心プロファイルを抽出する手法を開発すること。
  • パーソナライズされたトピック重みを、パーソナライズ済みとノーマルなコンテンツ出力の比較によって、出力のみに依存する実用的な手法で推定すること。
  • 政治的帰属や医療関心といったセンシティブなトピックにおけるパーソナライゼーションの検出を可能にすることで、エンドユーザーのプライバシー研究を支援すること。
  • ユーザーが自分自身がどのようにパーソナライズされているかを監査・理解できるようにする、プライバシー保護型ツールの基盤を構築すること。

提案手法

  • 本手法は、トピックごとの重みがユーザーの関心レベルを反映するように、個人化ベクトル η をトピック上での重み付きベクトルとして構築する。
  • 同じ URL に対するパーソナライズ済みとノーマルなコンテンツ(例:検索結果)を比較し、ランク順のシフトを検出することで、トピックベースのパーソナライゼーションを特定する。
  • Latent Topic Personalization (LTP) モデルは、パーソナライゼーションをトピック分布上の確率的推論問題として定式化する。
  • LTP は、複数のクエリにおける観測されたランク順の差の尤度を最大化することで、η を生成モデルを用いて推定する。
  • トピックモデリング(例:LDA スタイル)を活用し、トピックを語彙の分布として定義することで、パーソナライゼーションの意味的解釈を可能にする。
  • 内部 OSP ロジックにアクセスできない状況でも、ランク順のシフトからトピック重みを学習する効率的な最適化アルゴリズムを用いて推論を実行する。

実験結果

リサーチクエスチョン

  • RQ1ユーザーの内部アルゴリズムや履歴にアクセスできない状況でも、オンラインサービスにおけるユーザーのパーソナライゼーションプロファイルを推定できるか?
  • RQ2パーソナライズ済みとノーマルなコンテンツのランク順の差は、どの程度トピックレベルでのユーザー関心を露呈するか?
  • RQ3ブラックボックス手法として、実世界の検索データから真の個人化ベクトル η をどの程度正確に回復できるか?
  • RQ4推定された個人化ベクトル η は、既知のユーザーのカテゴリーや関心と意味的に相関しているか?
  • RQ5この手法を用いることで、政治的帰属や医療関心といったセンシティブなトピックにおけるパーソナライゼーションを検出でき、プライバシー評価が可能になるか?

主な発見

  • LTP モデルは、実際の Google 検索データから 84% の R-precision を達成し、プロファイル推定において高い精度を示した。
  • 個々のユーザーでは、精度が 54% から 85% の範囲で変動しており、ユーザー間でのパーソナライゼーションの程度や一貫性の違いが反映されている。
  • 本手法は、'アルゴリズム' や 'アニメ&マンガ' といったトピックで η 値が高いユーザーに対して、結果がそれに応じて再ランク付けされていることを明確に特定でき、モデルの解釈可能性を裏付けた。
  • LTP は、Google 自身のカテゴリーラベル(例:'アニメ&マンガ' に対して η = 0.60)と一致する高 η トピックを正しく特定し、現実世界のユーザー分類と整合性があることを示した。
  • わずか 3 名のユーザーでも、推定された個人化ベクトルに基づくユーザー分類で最大 60% の精度を達成しており、本手法の頑健性を示している。
  • 本手法により、ユーザーが隠れたパーソナライゼーションプロファイルを発見できるようになり、エンドユーザーのプライバシー意識向上およびツール開発の新しい道筋を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。