Skip to main content
QUICK REVIEW

[論文レビュー] Federated $f$-Differential Privacy

Qinqing Zheng, Shuxiao Chen|arXiv (Cornell University)|Feb 22, 2021
Privacy-Preserving Technologies in Data参考文献 40被引用数 9
ひとこと要約

本稿では、フェデレーテッドラーニング向けに最適化された記録レベルのプライバシー概念として、フェデレーテッド$f$-微分プライバシーを導入する。これは、単一および共謀する攻撃者に対して個々のデータ記録を保護する。本稿は、Gaussian微分プライバシーの合成を用いて、明示的なプライバシー保証を達成するPriFedSyncフレームワークを提案する。視覚タスクにおけるプライバシー、精度、計算コストの明確なトレードオフを示している。

ABSTRACT

Federated learning (FL) is a training paradigm where the clients collaboratively learn models by repeatedly sharing information without compromising much on the privacy of their local sensitive data. In this paper, we introduce federated $f$-differential privacy, a new notion specifically tailored to the federated setting, based on the framework of Gaussian differential privacy. Federated $f$-differential privacy operates on record level: it provides the privacy guarantee on each individual record of one client's data against adversaries. We then propose a generic private federated learning framework {PriFedSync} that accommodates a large family of state-of-the-art FL algorithms, which provably achieves federated $f$-differential privacy. Finally, we empirically demonstrate the trade-off between privacy guarantee and prediction performance for models trained by {PriFedSync} in computer vision tasks.

研究の動機と目的

  • フェデレーテッドラーニングにおける個々のデータ記録のプライバシー保証のギャップを埋めること、特に実用的でないほど強いユーザーレベルのプライバシーが課題となる状況を想定する。
  • 単一および共謀する攻撃者に対して個々の記録を保護する、弱いおよび強いフェデレーテッド$f$-微分プライバシーという新しいプライバシー概念を形式化すること。
  • 信頼できるサーバーを必要とせず、パーソナライズドおよびグローバルモデルの両方をサポートする、汎用的で合成可能かつ実用的なプライベートフェデレーテッドラーニングフレームワーク、PriFedSyncを設計すること。
  • 非独立同分布(non-IID)データ環境下での、プライバシー、モデル精度、計算コストのトレードオフを実験的に評価すること。

提案手法

  • Gaussian微分プライバシー(GDP)に基づき、個々のデータ記録ごとのプライバシー保証を有する、弱いおよび強いフェデレーテッド$f$-微分プライバシーの概念を提案する。
  • 標準的なFLアルゴリズム(例:FedAvg、FedSGD)と統合できるPriFedSyncフレームワークを設計し、クライアントレベルでのノイズ注入によりプライバシーを確保する。
  • GDPの合成定理を適用して、複数のトレーニングラウンドおよびクライアント更新における累積的プライバシー損失を導出する。
  • 局所モデル勾配にGaussianメカニズムによるノイズ注入を実施し、プライバシーパラメータをデータサンプリングレートおよびトレーニングイテレーションに応じてスケーリングする。
  • クライアントがローカルモデルを維持し、集約された更新のみを共有する、パーソナライズドモデル更新戦略を採用することで、データの非均質性下でのパフォーマンスを向上させる。
  • 漸近的解析を用いて収束性とプライバシーを分析し、GDPフレームワーク下での理論的保証を提示する。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドラーニングにおいて、クライアントレベルではなく個々の記録レベルでのプライバシー保証を提供することは可能か?
  • RQ2複数の悪意あるクライアントが共謀して個人情報を推定しようとする状況で、個々のデータ記録をどのように保護できるか?
  • RQ3プライベートフェデレーテッドラーニングにおける、プライバシー、モデル精度、計算コストのトレードオフは何か?
  • RQ4パーソナライズドフェデレーテッドラーニングは、データの非均質性下でもパフォーマンスを向上させつつ、強力なプライバシーを維持できるか?
  • RQ5バッチサイズおよびトレーニングイテレーションの選択が、プライベートFLにおけるプライバシー-精度トレードオフにどのように影響するか?

主な発見

  • PriFedSyncにおけるパーソナライズドモデルは、同じプライバシー予算下で非IIDデータ環境下でグローバルモデルを著しく上回り、より高いテスト精度を達成した。
  • バッチサイズを小さくするとプライバシーが強化される(プライバシーパラメータ$\mu_{\max}$が低くなる):$B=8$では$B=16$と比較して約$0.83\times$のプライバシーパラメータを示した。
  • バッチサイズを小さくすると計算コストが増加する:$B=8$では$90\%$の精度に到達するまでに$2.78\times$多くのトレーニングラウンドと$1.39\times$多くの合計サンプルを必要とした。
  • CIFAR-10で$\beta=0.5$の場合、$\sigma=0.5$で207ラウンド後に平均トップ1テスト精度が$52\%$に達したのに対し、非プライベートモデルでは$59.61\%$を達成した。
  • ノイズを含むAdam最適化子は、プライベートモデルにおいてSGDよりも安定性に優れたが、非プライベートモデルではSGDの方が一般化性能に優れた。
  • プライバシーパラメータ$\mu_{\max}$は、データサンプリングレートと$\sqrt{KR}$の積に線形に比例することが確認され、理論的プライバシー合成境界を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。