Skip to main content
QUICK REVIEW

[論文レビュー] Differentially Private Vertical Federated Learning

Thilina Ranbaduge, Ming Ding|arXiv (Cornell University)|Nov 13, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本論文は、トレーニング中にモデル勾配に校正されたノイズを注入することでプライバシーを強化する、差分プライバシーを適用した垂直フェデレーテッドラーニングフレームワークを提案する。プライバシー予算とモデル性能のバランスをとることで、垂直に分割されたデータにおける共同学習におけるプライバシー保護と実用的妥当性の間の実用的トレードオフを達成する。

ABSTRACT

A successful machine learning (ML) algorithm often relies on a large amount of high-quality data to train well-performed models. Supervised learning approaches, such as deep learning techniques, generate high-quality ML functions for real-life applications, however with large costs and human efforts to label training data. Recent advancements in federated learning (FL) allow multiple data owners or organisations to collaboratively train a machine learning model without sharing raw data. In this light, vertical FL allows organisations to build a global model when the participating organisations have vertically partitioned data. Further, in the vertical FL setting the participating organisation generally requires fewer resources compared to sharing data directly, enabling lightweight and scalable distributed training solutions. However, privacy protection in vertical FL is challenging due to the communication of intermediate outputs and the gradients of model update. This invites adversary entities to infer other organisations underlying data. Thus, in this paper, we aim to explore how to protect the privacy of individual organisation data in a differential privacy (DP) setting. We run experiments with different real-world datasets and DP budgets. Our experimental results show that a trade-off point needs to be found to achieve a balance between the vertical FL performance and privacy protection in terms of the amount of perturbation noise.

研究の動機と目的

  • 同じユーザーベース上で特徴量を共有するが、生データを共有しない垂直フェデレーテッドラーニング(VFL)における機微なデータの保護という課題に対処する。
  • VFLトレーニング中に交換される中間的なモデル更新と勾配からのプライバシー漏洩を軽減する。
  • 差分プライバシー(DP)をVFLにおける形式的なプライバシー保証として導入し、共有された勾配から個々の機関のデータが再構築できないことを保証する。
  • 実験的評価を通じて、プライバシー(DP予算)とモデル性能の最適なトレードオフを同定する。
  • 垂直に分割されたデータを有する実世界の環境において、プライバシー保護型共同機械学習のスケーラブルで軽量なソリューションを提供する。

提案手法

  • データ所有者と中央サーバー間で交換される勾配に校正されたノイズを追加することで、垂直フェデレーテッドラーニングにおける勾配更新に差分プライバシーを適用する。
  • 差分プライバシーを適用するための前提条件として、勾配クリッピングを用いてモデル更新の感度を制限する。
  • VFLトレーニング中の確率的勾配降下法(SGD)最適化プロセスにDPノイズ注入を統合する。
  • 各更新に対して(ε, δ)-差分プライバシーを保証するため、ラプラス機構を用いて勾配を摂動する。
  • さまざまなDP予算(ε)がモデル精度とプライバシー保証に与える影響を、実世界のデータセットを用いて評価する。
  • クリッピングノルムとプライバシー予算に基づいてノイズスケールを調整することで、モデルの有用性を維持する。

実験結果

リサーチクエスチョン

  • RQ1どのように差分プライバシーを垂直フェデレーテッドラーニングに効果的に適用し、推論攻撃からの機微なデータを保護できるか?
  • RQ2VFLにおける勾配にDPノイズを適用する際、モデル性能とプライバシー保護の間のトレードオフはどのように変化するか?
  • RQ3DP予算(ε)を変化させると、VFLにおけるグローバルモデルの精度と収束にどのような影響を与えるか?
  • RQ4特に1つの機関がラベルを保有している場合に、DPノイズ注入はラベル推論攻撃を防止できるか?
  • RQ5VFLにおいてプライバシーとモデル有用性のバランスを取るために、クリッピングノルムとノイズスケールの最適な設定は何か?

主な発見

  • プライバシー保護とモデル性能の間にはトレードオフが必要であり、DP予算(ε)を増加させるとモデル精度は向上するが、プライバシー保証は低下する。
  • VFLにおける勾配にDPノイズを追加するとモデルの有用性が低下するが、クリッピングノルムとノイズスケールを慎重に調整することでその影響を最小限に抑えることができる。
  • 実世界のデータセットを用いた実験結果から、中程度のDP予算(例:ε ≈ 1–3)がプライバシーとモデル精度の間で妥当なバランスを達成していることが示された。
  • 提案手法は、1つの機関が機微なラベルを保有している場合でも、勾配情報の曇りを加えることでラベル推論攻撃のリスクを効果的に低減する。
  • このフレームワークはスケーラビリティと効率性を維持しており、生データを共有しないことにためらうデータ所有者にとって実世界の応用に適している。
  • 本研究は、フェデレーテッドアンリーニングやVFLにおける倫理的データ利用など、プライバシー保護メカニズムに関するさらなる研究の必要性を浮き彫りにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。