Skip to main content
QUICK REVIEW

[論文レビュー] Data Leakage via Access Patterns of Sparse Features in Deep Learning-based Recommendation Systems

Hanieh Hashemi, Wenjie Xiong|arXiv (Cornell University)|Dec 12, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

この論文は、モデル計算が隠されている場合でも、深層学習ベースの推薦システムにおける埋め込みテーブルへのアクセスパターンが、個人のプライベート情報を漏洩させる可能性があることを明らかにしている。スパース特徴の参照を分析することで、信頼できないクラウド環境にいる攻撃者は、ユーザーを再識別し、感受性の高い属性を推定し、時間経過に伴う行動を追跡できる。これは、フェデレーテッドラーニング や ORAM といった既存の保護手法が、リアルタイム推論に対しては不十分であることを示している。

ABSTRACT

Online personalized recommendation services are generally hosted in the cloud where users query the cloud-based model to receive recommended input such as merchandise of interest or news feed. State-of-the-art recommendation models rely on sparse and dense features to represent users' profile information and the items they interact with. Although sparse features account for 99% of the total model size, there was not enough attention paid to the potential information leakage through sparse features. These sparse features are employed to track users' behavior, e.g., their click history, object interactions, etc., potentially carrying each user's private information. Sparse features are represented as learned embedding vectors that are stored in large tables, and personalized recommendation is performed by using a specific user's sparse feature to index through the tables. Even with recently-proposed methods that hides the computation happening in the cloud, an attacker in the cloud may be able to still track the access patterns to the embedding tables. This paper explores the private information that may be learned by tracking a recommendation model's sparse feature access patterns. We first characterize the types of attacks that can be carried out on sparse features in recommendation models in an untrusted cloud, followed by a demonstration of how each of these attacks leads to extracting users' private information or tracking users by their behavior over time.

研究の動機と目的

  • ユーザーのプライベートデータがスパース特徴の埋め込みテーブルへのアクセスパターンを通じて漏洩する可能性がある、深層学習ベースの推薦システムにおけるプライバシーの脆弱性を調査すること。
  • 信頼できないクラウド環境でアクセスパターンを悪用する攻撃(例:ユーザー再識別、感受性の高い属性の推定、頻度ベースの追跡)の種別を特定し、それらを分析すること。
  • 安全な計算技術や秘密ハッシュ関数を用いても、アクセスパターンの漏洩が生産スケールの推薦システムにおいて依然として深刻な脅威であることを実証すること。
  • フェデレーテッドラーニング やオーバーレイRAM(ORAM)といった現在のプライバシー保護技術が、推論中のアクセスパターン漏洩に対してどれほど効果的でないかを強調すること。
  • 研究の焦点を密度の高い特徴の漏洩から、未だ十分に調査されていない推薦モデルにおけるスパース特徴のアクセスパターン漏洩の脅威へとシフトさせること。

提案手法

  • DLRM などの最先端の推薦モデルのアーキテクチャを分析し、ユーザー年齢、性別、アイテムカテゴリなどスパース特徴が、大規模な埋め込みテーブルのインデックスとしてどのように使われるかを検討すること。
  • 信頼できないクラウドサーバーが埋め込みテーブルへのアクセスパターンを観測し、それらをユーザー行動と相関させることでプライベート情報を推測する脅威シナリオをモデル化すること。
  • 3種類の攻撃を設計・シミュレーションする:(1) 性別や年齢などの静的スパース特徴を用いたユーザー再識別、(2) 購入アイテムなど動的スパース特徴から感受性の高い属性を推定する攻撃、(3) 時間経過に伴うユーザー行動の頻度ベースの追跡。
  • 統計的およびパターン分析を用いて、特定の埋め込みテーブルインデックスへの繰り返しアクセスとユーザーIDや行動とを相関づけ、特徴値そのものに直接アクセスできない状況でも可能であることを示すこと。
  • フェデレーテッドラーニング や ORAM といった既存のプライバシー保護技術の有効性を、これらのアクセスパターン攻撃に対して評価し、リアルタイム推論ワークロードにおける限界を示すこと。
  • 入力の秘密ハッシュ化でさえも、埋め込みテーブルへのアクセスパターンが依然として情報漏洩を引き起こすことを実証し、入力のオーバーレイ化に加えて、パターンの隠蔽が不可欠であることを示すこと。

実験結果

リサーチクエスチョン

  • RQ1信頼できないクラウドにいる攻撃者は、年齢や性別といった静的スパース特徴のアクセスパターンに基づいて、どの程度の精度でユーザーを再識別できるか?
  • RQ2購入履歴やアイテムカテゴリなどの動的スパース特徴のアクセスパターン分析を通じて、人種、宗教、政治的立場などの感受性の高い属性を推定できるか?
  • RQ3埋め込みテーブルへのアクセスログのみを用いて、頻度ベースの追跡攻撃が、時間経過に伴うユーザー行動をどの程度正確に再構築できるか?
  • RQ4フェデレーテッドラーニング や ORAM といった既存のプライバシー保護技術が、推薦システムの推論におけるアクセスパターン漏洩を防ぐために不十分である理由は何か?
  • RQ5入力特徴の秘密ハッシュ化は、アクセスパターン漏洩を防げるか?それとも、埋め込みテーブルへのアクセスパターンが依然としてプライベート情報を露呈するか?

主な発見

  • モデルの内部計算が隠されている状況下でも、推薦システムにおける埋め込みテーブルへのアクセスパターンを用いることで、ユーザーの再識別が非常に高い精度で可能である。
  • 性別、人種、政治的立場などの感受性の高い属性は、アイテムカテゴリや購入履歴などの動的スパース特徴のアクセス頻度や順序を分析することで、埋め込みテーブルへのアクセスパターンから推定可能である。
  • 頻度ベースの追跡攻撃は、埋め込みテーブルへのアクセスログのみを用いても、長期にわたるユーザー行動のパターンを再構築でき、アクセスパターンに基づく長期的なユーザープロファイリングが可能である。
  • 入力の秘密ハッシュ化でさえも、埋め込みテーブルへのアクセスパターンが依然として情報を漏洩させるため、入力のオーバーレイ化だけではプライバシー保護として不十分であることが実証された。
  • フェデレーテッドラーニング や ORAM といった既存のプライバシー保護技術は、リアルタイム推論における性能のオーバーヘッドが大きく、動的アクセスパターンと互換性がないため、推薦システムのアクセスパターン漏洩に対しては効果が薄い。
  • 本論文は、密度の高い特徴の漏洩は既に研究されている一方で、埋め込みテーブルがモデルパラメータの99%を占めるにもかかわらず、スパース特徴のアクセスパターン漏洩はほとんど調査されていないという、研究上の重要な空白を特定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。