Skip to main content
QUICK REVIEW

[論文レビュー] Reducing Offline Evaluation Bias in Recommendation Systems

Arnaud De Myttenaere, Bénédicte Le Grand|arXiv (Cornell University)|Jul 3, 2014
Recommender Systems and Techniques参考文献 8被引用数 13
ひとこと要約

本稿では、過去の推薦アルゴリズムがユーザー行動に影響を与えることによる共変量シフトの影響を受ける推薦システムのオフライン評価におけるバイアスを低減するための重み付きオフライン評価手法を提案する。時間間隔における確率のシフトに基づいて調整可能なアイテム重みを割り当てることで、評価スコアの安定化を図り、実世界のViadeoデータにおいて生産用アルゴリズムの過剰評価を顕著に低減する。

ABSTRACT

Recommendation systems have been integrated into the majority of large online systems. They tailor those systems to individual users by filtering and ranking information according to user profiles. This adaptation process influences the way users interact with the system and, as a consequence, increases the difficulty of evaluating a recommendation algorithm with historical data (via offline evaluation). This paper analyses this evaluation bias and proposes a simple item weighting solution that reduces its impact. The efficiency of the proposed solution is evaluated on real world data extracted from Viadeo professional social network.

研究の動機と目的

  • 過去の推薦アルゴリズムがユーザー行動に影響を与える歴史的データに起因する、推薦システムにおけるオフライン評価バイアスの増大という問題に対処すること。
  • 頻繁に推薦されるアイテムの予測可能性の上昇に起因し、時間経過とともに生産用アルゴリズムの性能が過剰に評価されがちな、オフライン評価の傾向を特定すること。
  • 基準評価時以降に生成された新しいデータを破棄せずに、一般化可能なバイアス低減手法を提案すること。
  • アイテム人気の分布シフトを補正することで、一定の推薦アルゴリズムのオフライン評価スコアを安定化させること。
  • 実世界のプロフェッショナルソーシャルネットワークデータを用いて、非優位なアルゴリズムの性能低下を低減する手法の有効性を示すこと。

提案手法

  • 2つの時刻間でのアイテム人気確率のシフトを補正するため、各アイテムに調整可能な重みを割り当てる重み付き評価フレームワークを導入する。
  • 履歴データに基づきユーザー-アイテム確率を再重み付けするための重み関数 $ P(i|u,\omega) = \frac{\omega_i P(i|u)}{\sum_{j \in I} \omega_j P(j|u)} $ を使用する。
  • ベース分布と重み付き分布のKullback-Leibler発散 $ D(\omega) = \sum_i \frac{P_{t_0}(i)}{P_{t_1}(i|\omega)} \log \frac{P_{t_1}(i|\omega)}{P_{t_0}(i)} $ を最小化することで重みを最適化する。
  • 勾配の解析的表現を用いて発散の勾配を計算する: $ \frac{\partial P(i|u,\omega)}{\partial \omega_k} = \frac{P(k|u,\omega)}{\omega_k}(\delta_{ik} - P(i|u,\omega)) $。
  • 勾配に基づく最適化により、評価バイアスを低減しつつ、全履歴データを保持する最適な重みを特定する。
  • ユーザー-アイテムインシデント行列を事前計算し、スパarsityを活用することで、$ p $ 個の有効な重みに対して $ \mathcal{O}(p \cdot N_{U \times I}) $ の計算量を達成する。

実験結果

リサーチクエスチョン

  • RQ1過去のアルゴリズムの影響がユーザー行動に与える影響により、オフライン評価が生産用推薦アルゴリズムの性能をどの程度過剰に評価しているのか。
  • RQ2過去の推薦によるアイテム人気の分布シフトを補正するには、オフライン評価をどのように調整すべきか。
  • RQ3単純なアイテム重み付けスキームが、生産システムで優位でないアルゴリズムのオフライン評価スコアを効果的に安定化させられるか。
  • RQ4有効な重みの数が、安定的または不安定なアイテム推薦を行うアルゴリズムにおいて、バイアス低減性能に与える影響は何か。
  • RQ5提案手法は、基準評価時以降に生成された新しいデータを破棄せずに、時間経過に伴って評価の安定性を維持できるか。

主な発見

  • 提案された重み付け手法は、特に生産システムで優位でないアルゴリズムにおいて、オフライン評価バイアスを顕著に低減する。
  • 優位なアルゴリズム $ g^1 $ の場合、アイテム人気の時間的変動が著しいため、$ p=20 $ 個の有効な重みで性能の安定化が達成される。
  • 非優位なアルゴリズム $ g^2 $ の場合、外部要因によって人気となるアイテムを適切に推薦できないため、性能低下が生じる。このため、安定化にはより多くの重み($ p>20 $)が必要となる。
  • 本手法は「勝者獲得」バイアスを効果的に緩和し、生産用アルゴリズムの過剰評価を防ぎ、非優位なアルゴリズムの公平な比較を可能にする。
  • 重みの勾配ベース最適化は計算的に実行可能であり、$ \mathcal{O}(p \cdot N_{U \times I}) $ の計算量を有するため、大規模データセットに対してもスケーラブルである。
  • 本手法は、新しい相互作用を破棄せずに全履歴データを統合することで、共変量シフトに対して頑健な評価の整合性を維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。