Skip to main content
QUICK REVIEW

[論文レビュー] Privacy Threats Against Federated Matrix Factorization

Dashan Gao, Ben Tan|arXiv (Cornell University)|Jul 3, 2020
Privacy-Preserving Technologies in Data参考文献 17被引用数 12
ひとこと要約

本稿は、水平、垂直、分散転送MFの3つのデータ分割タイプにおけるフェデレーテッド行列分解(MF)のプライバシー脅威を特定・分析し、誠実だが好奇心の強い参加者がプライベートなユーザーの好み、ユーザーID、プロファイルデータを推測できる方法を示している。また、暗号化、誤魔化しベース、ハードウェアベースのプライバシー保護技術を提案してこれらのリスクを軽減しており、フェデレーテッドMFにおけるプライバシー脅威を包括的に研究した最初の論文である。

ABSTRACT

Matrix Factorization has been very successful in practical recommendation applications and e-commerce. Due to data shortage and stringent regulations, it can be hard to collect sufficient data to build performant recommender systems for a single company. Federated learning provides the possibility to bridge the data silos and build machine learning models without compromising privacy and security. Participants sharing common users or items collaboratively build a model over data from all the participants. There have been some works exploring the application of federated learning to recommender systems and the privacy issues in collaborative filtering systems. However, the privacy threats in federated matrix factorization are not studied. In this paper, we categorize federated matrix factorization into three types based on the partition of feature space and analyze privacy threats against each type of federated matrix factorization model. We also discuss privacy-preserving approaches. As far as we are aware, this is the first study of privacy threats of the matrix factorization method in the federated learning framework.

研究の動機と目的

  • 特徴空間の分割に基づいてフェデレーテッド行列分解を3つのタイプに分類すること:水平、垂直、フェデレーテッド転送MF。
  • 各フェデレーテッドMFタイプにおけるプライバシー脅威を分析すること、特に誠実だが好奇心の強い参加者がプライベートなユーザーの好み、ユーザーID、プロファイルデータをどのように推測できるかを特定すること。
  • 各フェデレーテッドMF設定が推論攻撃に対してどの程度耐性を示すかを評価すること。
  • 中間計算を保護するためのプライバシー保護技術—暗号化、誤魔化し、ハードウェアベースの手法—を提案・議論すること。
  • 将来的な攻撃効果の実証的評価の基盤を築くこと、および交替最小二乗法のような他のMFバリアントへの応用を拡張すること。

提案手法

  • データおよびパラメータの分割に基づいてフェデレーテッドMFを3つのタイプに分類:水平(共有ユーザー/アイテム)、垂直(異種特徴)、フェデレーテッド転送(共有ユーザー/アイテムで部分的モデルパラメータを共有)。
  • 誠実だが好奇心の強い脅威モデルを想定し、参加者が勾配と共有パラメータからプライベートデータを推測するために共謀する訓練プロセスをモデル化。
  • 勾配とパラメータの交換パターンを分析して、ユーザーID、ユーザーの好み、プロファイル行列のリークベクトルを同定。
  • 中間計算を保護するための暗号化ソリューション(例:同型暗号化(HE)と秘密分散)を提案。
  • 誤魔化しベースの手法(例:微分プライバシー(DP))を評価するが、データのスパarsityの影響によりノイズの問題が生じる可能性を指摘。
  • 信頼実行環境(TEEs)を用いたハードウェアベースのアプローチについて議論し、訓練計算を隔離・保護する。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドラーニングフレームワーク下で、水平、垂直、フェデレーテッド転送MFにおけるプライバシー脅威の特徴は何か?
  • RQ2誠実だが好奇心の強い参加者が、フェデレーテッドMFにおけるモデル更新からどのようにプライベートなユーザーの好み、ユーザーID、またはプロファイルデータを推測できるか?
  • RQ3パラメータ共有と勾配公開に基づく推論攻撃に対して、各フェデレーテッドMF設定の相対的な耐性はどの程度か?
  • RQ4暗号化、誤魔化し、ハードウェア隔離のうち、どのプライバシー保護技術がフェデレーテッドMFの保護に最も効果的か?
  • RQ5データのスパarsityとモデル構造は、フェデレーテッドMFにおける微分プライバシーの実行可能性とノイズの影響にどのように影響するか?

主な発見

  • 水平フェデレーテッドMFは、全モデルパラメータを共有するため、ユーザーIDや完全なユーザーの好みデータといった最もプライベートな情報が露出する。
  • 垂直フェデレーテッドMFでは、レコメンダが共有パラメータからユーザーIDを推測可能であるが、補助データ提供者はレコメンダに対して何ら情報をリークしない。
  • フェデレーテッド転送MFは、プライベートなレーティングスコアとユーザー/アイテムプロファイルをリークするが、ユーザーIDは露出しないため、中程度の耐性を示す。
  • フェデレーテッドMFにおける勾配とパラメータの交換プロセスは、高い正確性でプライベートな訓練データを再構築可能な推論攻撃を可能にする。
  • 同型暗号化や秘密分散といった暗号化技術は、中間データの保護に有効であるが、通信オーバーヘッドが依然として課題である。
  • 微分プライバシーはスパースなMF設定では過剰なノイズを導入し、モデルの有用性を低下させる可能性がある一方、TEEsは強力な隔離を提供するが、ハードウェアの信頼性に依存する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。