Skip to main content
QUICK REVIEW

[論文レビュー] Influence Function based Data Poisoning Attacks to Top-N Recommender Systems

Minghong Fang, Neil Zhenqiang Gong|arXiv (Cornell University)|Feb 19, 2020
Stochastic Gradient Optimization Techniques参考文献 35被引用数 6
ひとこと要約

この論文は、戦略的に設計されたレーティングを持つ偽のユーザーを挿入することで、行列分解に基づくトップ-Nレコメンデーションシステムを操作する影響関数に基づくデータ汚染攻撃を提案する。影響力のある通常ユーザーを同定し、勾配ベースの手法を用いてレーティングを最適化することで、Yelpでは0.5%の偽ユーザーで目標アイテムの露出を150倍に増加させ、先行手法を上回り、検出メカニズムに対しても効果を示す。

ABSTRACT

Recommender system is an essential component of web services to engage users. Popular recommender systems model user preferences and item properties using a large amount of crowdsourced user-item interaction data, e.g., rating scores; then top-$N$ items that match the best with a user's preference are recommended to the user. In this work, we show that an attacker can launch a data poisoning attack to a recommender system to make recommendations as the attacker desires via injecting fake users with carefully crafted user-item interaction data. Specifically, an attacker can trick a recommender system to recommend a target item to as many normal users as possible. We focus on matrix factorization based recommender systems because they have been widely deployed in industry. Given the number of fake users the attacker can inject, we formulate the crafting of rating scores for the fake users as an optimization problem. However, this optimization problem is challenging to solve as it is a non-convex integer programming problem. To address the challenge, we develop several techniques to approximately solve the optimization problem. For instance, we leverage influence function to select a subset of normal users who are influential to the recommendations and solve our formulated optimization problem based on these influential users. Our results show that our attacks are effective and outperform existing methods.

研究の動機と目的

  • 行列分解に基づくトップ-Nレコメンデーションシステムにおける有効なデータ汚染攻撃の設計に関するギャップを埋めること。
  • 最適な偽ユーザーのレーティングを選択する問題を非凸整数計画問題として定式化すること。
  • 挑戦的な最適化問題を効率的に解く近似手法を開発すること。
  • 影響関数を活用して影響力のあるキーユーザーを同定することで、攻撃の隠れ性と効果を向上させること。
  • 偽ユーザー検出メカニズムに対しても耐性を持つ攻撃の耐性を評価すること。

提案手法

  • 目標アイテムが通常ユーザーのトップ-Nレコメンデーションに表示される人数を最大化する最適化問題として攻撃を定式化する。
  • 整数レーティングの連続的リラクゼーションを用い、影響を受けるユーザー数を近似する微分可能な損失関数を適用する。
  • 影響関数理論を用いて、目標アイテムのレコメンデーションに最も影響を与える影響力のある通常ユーザーのサブセットを同定する。
  • 影響力のあるユーザー選択における下位モジュラル性を活用し、貪欲アルゴリズムを用いて(1−1/e)の近似比を達成する。
  • 勾配ベースの最適化アルゴリズムを用いて、影響力のあるユーザー集合に基づき、偽ユーザーの最適レーティングスコアを計算する。
  • すべての通常ユーザーに影響力を重み付けすることで、サブセット選択を超える攻撃効果を向上させる。

実験結果

リサーチクエスチョン

  • RQ1影響関数に基づく影響力のあるユーザーの選択は、行列分解に基づくトップ-Nレコメンデーションシステムにおけるデータ汚染攻撃の効果を向上させることができるか?
  • RQ2提案手法の攻撃は、既存のデータ汚染手法と比較して、目標アイテムの露出と隠れ性の観点でどのように異なるか?
  • RQ3レコメンデーションシステムに偽ユーザー検出メカニズムが組み込まれた場合でも、攻撃はどの程度効果を保つのか?
  • RQ4影響関数フレームワークは、サブセット選択にとどまらず、すべての通常ユーザーに影響力を重み付ける形に一般化可能か?また、これにより攻撃性能がさらに向上するか?
  • RQ5同じ影響関数アプローチを、グラフベースのトップ-Nレコメンデーションシステムにおける攻撃強化にも適用可能か?

主な発見

  • Yelpデータセットでは、0.5%の偽ユーザーを挿入した場合、目標アイテムの露出が150倍に増加した。
  • Yelpでは攻撃サイズが5%のとき、ヒットレートが0.6924に達し、ベースライン手法を著しく上回った。
  • 影響関数に基づく攻撃は、偽ユーザーを検出するためのバイナリ分類器に対しても効果を示し、優れた隠れ性を示した。
  • すべての通常ユーザーに影響力を重み付けすることで、サブセット選択を上回る攻撃効果が得られ、Yelpでは攻撃サイズ5%でヒットレート0.6924を達成した。
  • この手法はグラフベースのレコメンデーションシステムに対しても効果的に一般化され、先行研究を上回る攻撃成功確率を達成した。
  • 影響関数に基づくアプローチにより、影響力のあるユーザー選択において(1−1/e)の近似比が達成され、理論的な性能保証が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。