Skip to main content
QUICK REVIEW

[論文レビュー] FedV: Privacy-Preserving Federated Learning over Vertically Partitioned Data

Runhua Xu, Nathalie Baracaldo|arXiv (Cornell University)|Mar 5, 2021
Privacy-Preserving Technologies in Data参考文献 57被引用数 16
ひとこと要約

FedVは、関数暗号を用いて複数の参加者間で安全かつ非インタラクティブな勾配集約を可能にする、垂直分割データ向けのプライバシー保護型フェデレーテッドラーニングフレームワークである。これによりピアツーピア通信の必要がなくなり、10%〜70%の高速化と、最新の手法と比較して80%〜90%のデータ転送量削減を達成する。近似やノイズ摂動を必要とせず、線形モデル、ロジスティック回帰、SVMをサポートする。

ABSTRACT

Federated learning (FL) has been proposed to allow collaborative training of machine learning (ML) models among multiple parties where each party can keep its data private. In this paradigm, only model updates, such as model weights or gradients, are shared. Many existing approaches have focused on horizontal FL, where each party has the entire feature set and labels in the training data set. However, many real scenarios follow a vertically-partitioned FL setup, where a complete feature set is formed only when all the datasets from the parties are combined, and the labels are only available to a single party. Privacy-preserving vertical FL is challenging because complete sets of labels and features are not owned by one entity. Existing approaches for vertical FL require multiple peer-to-peer communications among parties, leading to lengthy training times, and are restricted to (approximated) linear models and just two parties. To close this gap, we propose FedV, a framework for secure gradient computation in vertical settings for several widely used ML models such as linear models, logistic regression, and support vector machines. FedV removes the need for peer-to-peer communication among parties by using functional encryption schemes; this allows FedV to achieve faster training times. It also works for larger and changing sets of parties. We empirically demonstrate the applicability for multiple types of ML models and show a reduction of 10%-70% of training time and 80% to 90% in data transfer with respect to the state-of-the-art approaches.

研究の動機と目的

  • ピアツーピア通信や近似技術に依存する既存の垂直フェデレーテッドラーニング(VFL)フレームワークの非効率性とスケーラビリティの制限を解消すること。
  • すべての特徴量やラベルを1つの参加者が保有しない垂直分割データ環境において、安全で非インタラクティブなモデル勾配集約を可能にすること。
  • 線形モデル、ロジスティック回帰、SVMを含む幅広い機械学習モデルを、テイラー展開近似や微分プライバシーのノイズを用いずにサポートすること。
  • 参加者がトレーニング中に参加・離脱できる動的参加を可能にすること。
  • 従来のセキュアマルチパーティ計算や同型暗号に基づくVFLソリューションと比較して、通信オーバーヘッドと計算コストを低減すること。

提案手法

  • FedVは関数暗号(FE)を用い、集約者が個々の勾配を学習せずに複数参加者の勾配の合計を計算可能にすることで、プライバシーを確保する。
  • フレームワークはピアツーピア通信を不要とする2段階の非インタラクティブなセキュア集約プロトコルを採用する。
  • 関数暗号を用いて特徴量ベクトルと勾配の内積を安全に計算することで、生データを露呈せずにモデル更新を実現する。
  • この手法は線形モデルおよび非線形モデル(ロジスティック回帰やカーネル付きSVMを含む)をサポートし、テイラー級数展開に依存しない。
  • 参加者はFEを用いてローカル勾配を暗号化し、集約者が集約結果を復号することでグローバルモデルを更新する。
  • システムは動的参加を処理できるように設計されており、トレーニング中に参加者が追加・退出しても再構成を必要としない。

実験結果

リサーチクエスチョン

  • RQ1ピアツーピア通信を排除しつつもモデルの精度を維持できるプライバシー保護型VFLフレームワークを設計できるか?
  • RQ2関数暗号を用いて、垂直分割データ環境において安全で非インタラクティブな勾配集約を実現できるか?
  • RQ3FedVは、テイラー展開やノイズ注入を用いずに、SVMのような非線形モデルを含む幅広い機械学習モデルをサポートできるか?
  • RQ4セキュアマルチパーティ計算や同型暗号に基づく既存のVFLソリューションと比較して、FedVのトレーニング効率と通信コストはどの程度か?
  • RQ5FedVは、参加者がトレーニング中に参加・離脱できる動的参加をサポートできるか?セキュリティや収束性に影響を与えないか?

主な発見

  • FedVは、ピアツーピア通信やセキュアマルチパーティ計算に依存する最新のVFL手法と比較して、トレーニング時間を10%〜70%短縮する。
  • 複数回のピアツーピア通信を不要とすることで、データ転送量を80%〜90%削減する。
  • FedVは、テイラー展開を用いずに線形モデル、ロジスティック回帰、カーネル付きSVMのトレーニングをサポートし、モデル精度を保持する。
  • システムは動的参加を可能にし、参加者がトレーニング中に参加・離脱しても集約プロセスに支障をきたさない。
  • 関数暗号に基づく集約により、個々の勾配や生データを露呈せずに安全な勾配計算が実現される。
  • 特に大規模な環境や不安定なネットワーク環境において、通信効率と計算コストの点で既存手法を上回る。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。