Skip to main content
QUICK REVIEW

[論文レビュー] FedSDG-FS: Efficient and Secure Feature Selection for Vertical Federated Learning

Anran Li, Hongyi Peng|arXiv (Cornell University)|Feb 21, 2023
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

FedSDG-FS は、ガウス確率的デュアルゲートと部分的に準同型暗号化(PHE)を用いて、垂直フェデレーテッドラーニング(VFL)におけるプライバシー保護型で効率的な特徴選択フレームワークを提案する。2回のパrameter送信でのみ実現可能な正確で適応的な特徴選択を可能にし、通信コストを顕著に削減することで、既存手法に比べてモデルの精度と安定性に優れ、データおよびラベルのプライバシーを保護する。

ABSTRACT

Vertical Federated Learning (VFL) enables multiple data owners, each holding a different subset of features about largely overlapping sets of data sample(s), to jointly train a useful global model. Feature selection (FS) is important to VFL. It is still an open research problem as existing FS works designed for VFL either assumes prior knowledge on the number of noisy features or prior knowledge on the post-training threshold of useful features to be selected, making them unsuitable for practical applications. To bridge this gap, we propose the Federated Stochastic Dual-Gate based Feature Selection (FedSDG-FS) approach. It consists of a Gaussian stochastic dual-gate to efficiently approximate the probability of a feature being selected, with privacy protection through Partially Homomorphic Encryption without a trusted third-party. To reduce overhead, we propose a feature importance initialization method based on Gini impurity, which can accomplish its goals with only two parameter transmissions between the server and the clients. Extensive experiments on both synthetic and real-world datasets show that FedSDG-FS significantly outperforms existing approaches in terms of achieving accurate selection of high-quality features as well as building global models with improved performance.

研究の動機と目的

  • ノイズが多い特徴や有用な特徴の数に関する事前知識が不要な、VFLにおける効率的かつ安全な特徴選択の課題を解決すること。
  • トレーニングおよび選択の全過程において、データおよびラベルが元の所有者に留まるプライバシー保護型の特徴選択を可能にすること。
  • パrameter送信回数と埋め込みベクトルのサイズを最小限に抑えることで、VFLにおける通信および計算コストを低減すること。
  • 共同トレーニング中に高品質で文脈に適した特徴を正確に特定・選択することで、グローバルモデルのパフォーマンスを向上させること。
  • さまざまな選択された特徴数やトレーニングラウンドにわたり、高いモデル精度を維持する安定的で適応的な特徴選択メカニズムの設計

提案手法

  • 微分可能でプライバシー保護型の方法で、特徴選択の尤度を確率的に近似するためのガウス確率的デュアルゲート機構を導入する。
  • Gini不純度に基づく特徴重要度の初期化を採用し、サーバーとクライアント間の2回のパrameter送信で、ノイズの多い特徴を迅速にフィルタリングする。
  • 部分的に準同型暗号化(PHE)を活用して、生データやラベルを露呈させることなく特徴選択スコアを安全に計算する。
  • さらにプライバシーを強化するために、特徴選択およびモデルトレーニング中にランダムなノイズを導入するメカニズムを適用する。
  • 確率的デュアルゲートを用いて埋め込みベクトルのサイズを縮小し、VFLシステムにおける通信コストを低減する。
  • 特徴選択をモデルトレーニングプロセスに直接統合することで、共同最適化と文脈に適した選択を可能にする。
(a) Accuracy and model size vs. number of participating features
(a) Accuracy and model size vs. number of participating features

実験結果

リサーチクエスチョン

  • RQ1VFLにおいて、ノイズ特徴や有用特徴の数に関する事前知識がなくても、特徴選択を効率的かつ適応的に行うにはどうすればよいか?
  • RQ2VFLにおいて、データおよびラベルが所有者に留まるように、特徴選択を安全に実施するにはどうすればよいか?
  • RQ3VFLベースの特徴選択における通信および計算コストを低減するメカニズムとして、どのようなものがあるか?
  • RQ4選択された特徴数やトレーニングイテレーションの変動にかかわらず、特徴選択の安定性と正確性をどのように確保できるか?
  • RQ5分離された特徴選択とトレーニングと比較して、共同トレーニングと選択のフレームワークは、グローバルモデルのパフォーマンスを向上させられるか?

主な発見

  • RELATHE データセットでは、0.44 の F1 スコアのしきい値で 99.8% のテスト精度を達成し、SFFS やオリジナルゲート手法を上回った。
  • ARCENE データセットでは、0.59 の F1 スコアのしきい値で 99.7% の精度に達し、SFFS や MS-GINI のベースラインを顕著に上回った。
  • 通信コストはベースライン手法と比較して 50% 以上削減され、ARCENE データセットでは 53.2%、GISETTE データセットでは 54.7% の削減が達成された。
  • 80 ラウンド目においても、テスト精度の低下はたった 2.8% にとどまり、オリジナルゲート手法の 17.9% の低下と比べて著しく安定性が高かった。
  • Gini 不純度に基づく特徴重要度の初期化により、ノイズの多い特徴が迅速にフィルタリングされ、トレーニング時間の短縮と収束の加速が達成された。
  • FedSDG-FS は、テーブルデータ、画像、テキスト、音声データを含む多数のデータセットで一貫したパフォーマンスを示し、その頑健性と一般化能力を確認した。
Figure 2: System overview of FedSDG-FS. $①$ Send encrypted embeddings, $②$ send encrypted gradients.
Figure 2: System overview of FedSDG-FS. $①$ Send encrypted embeddings, $②$ send encrypted gradients.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。