Skip to main content
QUICK REVIEW

[論文レビュー] Practical Privacy Attacks on Vertical Federated Learning

Haiqin Weng, Juntao Zhang|arXiv (Cornell University)|Nov 18, 2020
Privacy-Preserving Technologies in Data被引用数 8
ひとこと要約

本論文は、垂直フェデレーテッドラーニング(VFL)プロトコルに対する2つの実用的プライバシー攻撃——逆乗算攻撃と逆和攻撃——を提示しており、プロトコルの規定に違反せずに暗号化された中間出力から、プライベートなトレーニングデータを再構築できることを示している。これらの攻撃は効果的で、検知を避けやすく、事前の知識が最小限で実現可能であり、効率最適化されたVFL設計でさえ、暗号化を施しても重大なプライバシー漏洩のリスクを内在していることを明らかにしている。

ABSTRACT

Federated learning (FL) is a privacy-preserving learning paradigm that allows multiple parities to jointly train a powerful machine learning model without sharing their private data. According to the form of collaboration, FL can be further divided into horizontal federated learning (HFL) and vertical federated learning (VFL). In HFL, participants share the same feature space and collaborate on data samples, while in VFL, participants share the same sample IDs and collaborate on features. VFL has a broader scope of applications and is arguably more suitable for joint model training between large enterprises. In this paper, we focus on VFL and investigate potential privacy leakage in real-world VFL frameworks. We design and implement two practical privacy attacks: reverse multiplication attack for the logistic regression VFL protocol; and reverse sum attack for the XGBoost VFL protocol. We empirically show that the two attacks are (1) effective - the adversary can successfully steal the private training data, even when the intermediate outputs are encrypted to protect data privacy; (2) evasive - the attacks do not deviate from the protocol specification nor deteriorate the accuracy of the target model; and (3) easy - the adversary needs little prior knowledge about the data distribution of the target participant. We also show the leaked information is as effective as the raw training data in training an alternative classifier. We further discuss potential countermeasures and their challenges, which we hope can lead to several promising research directions.

研究の動機と目的

  • 暗号化プロトコルを用いても、実世界の垂直フェデレーテッドラーニング(VFL)フレームワークにおけるプライバシー漏洩リスクを調査すること。
  • プロトコル規定を逸脱せずに、VFLにおける暗号化された中間出力からプライベートなトレーニングデータを再構築できる実用的攻撃を設計すること。
  • FATE、PySyft、TF Federated などの広く使われているVFLフレームワーク上で、これらの攻撃の有効性と検知を避けやすい性質を評価すること。
  • 漏洩された情報が、代替分類器の学習に、元のデータと同等に効果的に利用できることを示し、プライバシー漏洩の深刻さを強調すること。
  • 将来的な対策策定のための可能性と、より強固なプライバシー保護型VFLプロトコルを構築する上で残された課題を議論すること。

提案手法

  • VFLにおけるセキュアロジスティック回帰プロトコルを標的とし、勾配更新の乗法的構造を活用してプライベート特徴量を逆算する逆乗算攻撃を設計する。
  • XGBoostベースのセキュアブーストプロトコルを標的とし、中間出力の加法的性質を活用してプライベートデータを再構築する逆和攻撃を開発する。
  • 両攻撃をFATEフレームワーク内に実装し、実世界のベンチマークデータセット上でその有効性を評価する。
  • 統計的および最適化的手法を用いて、生データにアクセスせずに暗号化されたモデル更新の集約結果からプライベート特徴量を推定する。
  • 漏洩された情報で訓練された代替分類器が、元のデータで学習したモデルと同等の性能を達成することを検証し、再構築データの高い有用性を確認する。
  • 攻撃がプロトコル規定に準拠しており、ターゲットモデルの精度を低下させないことを保証することで、検知を避けられるようにする。

実験結果

リサーチクエスチョン

  • RQ1暗号化された中間出力から、プライベートなトレーニングデータが、プライバシー保護を目的としたプロトコル設計のもとでも再構築可能か?
  • RQ2効率最適化されたVFLプロトコルは、信頼できるコーディネータが復号鍵を保有する状況において、どの程度データプライバシーを損なうのか?
  • RQ3逆乗算および逆和攻撃は、データ分布に関する事前の知識が最小限でも、プライベート特徴量をどの程度効果的に回復できるか?
  • RQ4これらの攻撃によって漏洩する情報は、高精度な代替分類器を学習するのに十分か? これは実世界のプライバシーリスクを示唆する。
  • RQ5このような攻撃に対する防御における実用的な課題は何か? そして、より安全なVFLシステムを構築するにあたり、どのような新たな研究方向性が示唆されるか?

主な発見

  • 逆乗算攻撃は、暗号化された勾配の乗法的構造を活用することで、ロジスティック回帰ベースのVFLにおいてプライベート特徴量を効果的に回復した。
  • 逆和攻撃は、中間出力の加法的性質に着目し、暗号化済みであってもXGBoostベースのVFLでプライベート特徴量を再構築できた。
  • 両攻撃とも有効である——ベンチマークデータセット上で、漏洩した情報で訓練した代替分類器は、元のデータで学習したモデルと同等の性能を示した。
  • 攻撃は検知を避けやすい——プロトコル規定に準拠しており、ターゲットモデルの精度を低下させない。
  • 攻撃には、ターゲット参加者のデータ分布に関する事前の知識が最小限で十分であり、実世界の企業間連携において実用的である。
  • 結果から、効率性を最適化したVFL設計でさえ、エンドツーエンド暗号化を施しても、予期しない形でプライバシーリスクを増大させる可能性があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。