[論文レビュー] Subject Granular Differential Privacy in Federated Learning
本稿は、連合学習における被験者粒度の微分プライバシー(DP)を導入し、被験者のデータが複数のユーザーに分散されている状況を想定する。本稿では、ユーザー側で被験者レベルのDPを強制する2つの新しいアルゴリズム—\localgroupdp および \higradavg —を提案する。\localgroupdpは、FEMNISTおよびShakespeareデータセットにおける実験的評価で、ユーザーレベルおよびアイテムレベルのDPベースラインを上回る、プライバシーとモデル効用の最良のトレードオフを達成する。
This paper considers subject level privacy in the FL setting, where a subject is an individual whose private information is embodied by several data items either confined within a single federation user or distributed across multiple federation users. We propose two new algorithms that enforce subject level DP at each federation user locally. Our first algorithm, called LocalGroupDP, is a straightforward application of group differential privacy in the popular DP-SGD algorithm. Our second algorithm is based on a novel idea of hierarchical gradient averaging (HiGradAvgDP) for subjects participating in a training mini-batch. We also show that user level Local Differential Privacy (LDP) naturally guarantees subject level DP. We observe the problem of horizontal composition of subject level privacy loss in FL - subject level privacy loss incurred at individual users composes across the federation. We formally prove the subject level DP guarantee for our algorithms, and also show their effect on model utility loss. Our empirical evaluation on FEMNIST and Shakespeare datasets shows that LocalGroupDP delivers the best performance among our algorithms. However, its model utility lags behind that of models trained using a DP-SGD based algorithm that provides a weaker item level privacy guarantee. Privacy loss amplification due to subject sampling fractions and horizontal composition remain key challenges for model utility.
研究の動機と目的
- 連合学習(FL)におけるプライバシーのギャップを埋めるために、被験者のデータが複数のユーザーに分散されている状況における被験者レベルの微分プライバシーを導入すること。
- アイテムレベルおよびユーザーレベルのプライバシー保証とは区別される、連合学習における被験者レベルDPの形式的定義を提示すること。
- 連合学習のユーザー側で被験者レベルDPを強制する2つの新しいアルゴリズム—\localgroupdp および \higradavg —の開発および分析を行うこと。
- ユーザーレベルローカル微分プライバシー(LDP)が自然に被験者レベルDPを満たすことを示し、比較のためのベースラインを提供すること。
- 被験者データの分布とプライバシー損失の水平的合成が、被験者レベルDP設定におけるモデル効用に与える影響を調査すること。
提案手法
- DP-SGDフレームワーク内でのグループ微分プライバシーのローカル適用として、\localgroupdpを提案。各ユーザーは、同じ被験者に属する全データアイテムの勾配に対してDPを適用する。
- 被験者基数に基づき、複数のレベルで勾配を集約する階層的勾配平均化技術である \higradavg を導入。これにより、被験者レベルの寄与が隠蔽される。
- 合成定理を用いて、凸損失関数下での \localgroupdp および \higradavg の被験者レベルDP保証を形式的に証明する。
- 被験者サンプリング率によるプライバシー強化を用い、ノイズスケールを低減。ノイズは各ミニバッチ内の最大被験者グループサイズに基づき調整される。
- 標準的なDP-SGDノイズ機構(ガウス機構)を勾配に適用。プライバシー予算は、各データアイテムやユーザーではなく、被験者グループごとに割り当てる。
- ユーザーレベルLDPをベースラインとして統合。個々のユーザーの寄与が隠蔽されるため、自然に被験者レベルDPを満たすことが示される。
実験結果
リサーチクエスチョン
- RQ1連合学習においてデータが複数のユーザーに分散されている状況で、被験者レベルの微分プライバシーを形式的に定義・保証することは可能か?
- RQ2被騢者レベルDPアルゴリズムと従来のアイテムレベルまたはユーザーレベルDPベースラインとの間で、モデル効用のトレードオフはどのように変化するか?
- RQ3連合学習ユーザー間での被験者データの非一様分布が、被験者レベルDPにおけるプライバシー-効用トレードオフに与える影響は何か?
- RQ4ユーザー間での被験者レベルプライバシー損失の水平的合成が、被験者レベルDPにおけるモデル効用に与える影響は何か?
- RQ5階層的勾配平均化は、被験者レベルプライバシーを保持しつつ、ノイズ増幅を効果的に低減できるか?
主な発見
- \localgroupdpは、提案された手法の中で最高のモデル効用を達成し、非プライベートなFedAvgと比較してFEMNISTでは15%、Shakespeareでは18%の性能低下にとどまる。
- アイテムレベルプライバシー保証が弱いものの、LocalItemDPは\localgroupdpを上回る効用を示し、FEMNISTでは8%、Shakespeareでは22%の性能低下にとどまる。
- ユーザーレベルLDPは\localgroupdpよりも顕著に高い効用損失を示し、観測された損失が高くなり、テスト精度が低くなることが明確に確認された。
- \higradavgは、被験者基数が高いデータセット(例:Shakespeare)では、ノイズスケールが最大1桁増幅するため、\localgroupdpより劣る性能を示す。
- 被験者データの非一様分布により、ミニバッチ内のグループサイズが増加し、プライバシー予算が減少し、\localgroupdpの性能が低下する。FEMNISTではα=16でテスト精度が50%未満に低下した。
- 被験者レベルプライバシー損失の水平的合成は、学習期間を制限し、モデル効用をさらに劣化させる。これは実用的導入における主要な課題を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。