Skip to main content
QUICK REVIEW

[論文レビュー] Vertical Federated Learning without Revealing Intersection Membership

Jiankai Sun, Yang Xin|arXiv (Cornell University)|Jun 10, 2021
Privacy-Preserving Technologies in Data参考文献 36被引用数 17
ひとこと要約

本論文は、プライベートセットインターセクション(PSI)の代わりにプライベートセットユニオン(PSU)プロトコルを採用することで、共有メンバー情報のプライバシーを保護する新しい垂直フェデレーテッドラーニング(vFL)フレームワークを提案する。このプロトコルは、共通のメンバーを特定するのではなく、データエンティティのユニオンのみを露呈する。フレームワークは、重複しないサンプルに対して合成特徴量とラベルを生成し、モデルの有効性を維持しながら、どの組織がどのエンティティを共有しているかをいかなる参加者も学習できないようにする。

ABSTRACT

Vertical Federated Learning (vFL) allows multiple parties that own different attributes (e.g. features and labels) of the same data entity (e.g. a person) to jointly train a model. To prepare the training data, vFL needs to identify the common data entities shared by all parties. It is usually achieved by Private Set Intersection (PSI) which identifies the intersection of training samples from all parties by using personal identifiable information (e.g. email) as sample IDs to align data instances. As a result, PSI would make sample IDs of the intersection visible to all parties, and therefore each party can know that the data entities shown in the intersection also appear in the other parties, i.e. intersection membership. However, in many real-world privacy-sensitive organizations, e.g. banks and hospitals, revealing membership of their data entities is prohibited. In this paper, we propose a vFL framework based on Private Set Union (PSU) that allows each party to keep sensitive membership information to itself. Instead of identifying the intersection of all training samples, our PSU protocol generates the union of samples as training instances. In addition, we propose strategies to generate synthetic features and labels to handle samples that belong to the union but not the intersection. Through extensive experiments on two real-world datasets, we show our framework can protect the privacy of the intersection membership while maintaining the model utility.

研究の動機と目的

  • 組織間で共有されているデータエンティティが特定されるという垂直フェデレーテッドラーニングにおける深刻なプライバシー漏洩問題に対処すること。
  • 従来のPSIベースのvFLシステムがすべての参加者に共通メンバーを露呈するという制限を克服すること。
  • 医療や金融などプライバシーが重要な分野において、機微なメンバー情報のプライバシーを保護する安全な、プライバシー保護型vFLフレームワークを構築すること。
  • 重複しないサンプルに合成データを用いるにもかかわらず、高いモデル有効性を維持すること。
  • 1人または非対称的にではなく、すべての参加者を同時に保護する、初めての共通メンバー保護ソリューションを提供すること。

提案手法

  • 従来のプライベートセットインターセクション(PSI)の代わりに、訓練サンプルのユニオンを特定する新しいプライベートセットユニオン(PSU)プロトコルを採用する。
  • 共通メンバーのサンプルIDを露呈しない安全なデータアライメントメカニズムを設計し、メンバー情報の漏洩を防止する。
  • 共通メンバーに属さないがユニオンに含まれるサンプルに対して、合成特徴量とラベル生成戦略を導入し、すべての利用可能なデータでモデル学習を可能にする。
  • モデルインバージョン攻撃の成功率を低下させるためにログィットシフトを適用し、メンバー情報推定攻撃に対するプライバシー強化を図る。
  • CriteoおよびAvazuデータセットで使用するため、埋め込み層と深層MLPを備えた変更版WDLモデルアーキテクチャを採用。Adamによる最適化で学習率1e-4で訓練。
  • Criteo(10%にサブサンプリング)および完全なAvazuデータセットを90%-10%に分割し、バッチサイズ8,192、1実験あたり3エポックで実験を実施。

実験結果

リサーチクエスチョン

  • RQ1すべての参加者が組織間で共有されているデータエンティティを特定できないように、vFLフレームワークを設計できるか?
  • RQ2サンプルのユニオンのみを用いて、共通メンバーの特定を露呈せずに安全にデータアライメントを実現できるか?
  • RQ3重複しないサンプルにおいて、プライバシーを保護しつつモデル有効性を維持するための合成データ生成戦略は何か?
  • RQ4提案フレームワークは、ベースラインvFLシステムと比較して、どの程度のモデルパフォーマンスを維持できるか?
  • RQ5ログィットシフト技術は、提案フレームワークにおけるメンバー情報推定攻撃の緩和にどの程度効果的か?

主な発見

  • 提案されたPSUベースのvFLフレームワークは、すべての参加者に対して共通メンバーの特定を完全に防ぎ、全参加者をプライバシー保護する初めてのソリューションを達成した。
  • メンバー情報推定攻撃のAUCは顕著に低下しており、特にログィットシフトを適用した場合、プライバシー侵害に対する強い耐性を示した。
  • fea-sampling戦略は、α=0.95のとき、ベースライン部分(partial)と比較してAUCが6.7%低下したが、これは高いデータ重複度下でも許容可能な有効性損失を示している。
  • 合成特徴量とラベルを併用し、ログィットシフトを適用した場合、ACE(攻撃信頼度推定値)は著しく低下し、モデルインバージョン攻撃に対する耐性が向上した。
  • α=β=0.05のとき、AUC低下は最小限(−0.066%)に抑えられ、α=β=0.95のときでも−11.71%に留まり、有効性の維持が顕著に確認された。
  • CriteoおよびAvazuの実世界データセットを用いた実験により、フレームワークが安全なユニオンベースのアライメントと合成データ生成により、高いモデル有効性を維持しながらプライバシーを確保できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。