[論文レビュー] Share Your Representation Only: Guaranteed Improvement of the Privacy-Utility Tradeoff in Federated Learning
本稿では、表現学習と分類ヘッドのパーソナライゼーションを分離することで、グローバル表現の微分プライバシー訓練を可能にするとともに、ローカルモデルのパーソナライゼーションを維持する、新しいフェデレーテッドラーニングフレームワークであるCENTAURを提案する。1つの微分プライバシー付きグローバル表現関数を訓練し、個々の分類ヘッドをローカルで適応可能にするアプローチにより、プライバシーと有用性のトレードオフが明確に改善され、線形表現設定下で同じプライバシー予算のもとで、先行研究と比較して√dの有用性向上を達成する。
Repeated parameter sharing in federated learning causes significant information leakage about private data, thus defeating its main purpose: data privacy. Mitigating the risk of this information leakage, using state of the art differentially private algorithms, also does not come for free. Randomized mechanisms can prevent convergence of models on learning even the useful representation functions, especially if there is more disagreement between local models on the classification functions (due to data heterogeneity). In this paper, we consider a representation federated learning objective that encourages various parties to collaboratively refine the consensus part of the model, with differential privacy guarantees, while separately allowing sufficient freedom for local personalization (without releasing it). We prove that in the linear representation setting, while the objective is non-convex, our proposed new algorithm \DPFEDREP\ converges to a ball centered around the \emph{global optimal} solution at a linear rate, and the radius of the ball is proportional to the reciprocal of the privacy budget. With this novel utility analysis, we improve the SOTA utility-privacy trade-off for this problem by a factor of $\sqrt{d}$, where $d$ is the input dimension. We empirically evaluate our method with the image classification task on CIFAR10, CIFAR100, and EMNIST, and observe a significant performance improvement over the prior work under the same small privacy budget. The code can be found in this link: https://github.com/shenzebang/CENTAUR-Privacy-Federated-Representation-Learning.
研究の動機と目的
- データの非同一性に起因する大きなローカル勾配がモデルの有用性を低下させる、微分プライバシー付きフェデレーテッドラーニングにおける根本的対立を解消すること。
- グローバル表現学習とローカル分類器のパーソナライゼーションを分離することで、プライバシーと有用性のトレードオフを改善すること。
- タイトなプライバシー予算下でも、共有表現の効率的かつ微分プライバシー付き最適化を可能にするとともに、高いモデル有用性を維持すること。
- 微分プライバシー制約下での提案手法の理論的収束保証を確立すること。
- 多様なデータセットおよびデータ非同一性レベルにおいて、本手法の優位性を実験的に検証すること。
提案手法
- ニューラルネットワークを共有グローバル表現関数とクライアント固有の分類ヘッドに分解する。
- グローバル表現の更新にのみ微分プライバシーを適用し、有界な感度を持つノイズ注入を実施する。
- スペクトル解析のためのノイズ付きパワー法の成功確率を向上させるために、交差検証スキームを採用する。
- 2段階の最適化を実施:グローバル表現は微分プライバシー付き確率的勾配降下法で訓練され、ローカルヘッドはクライアントごとに別個に訓練される。
- グローバル最適解のまわりの半径が1/εに比例する球内への線形収束を示す、新たな収束解析を導入する。
- 行列濃度不等式とスペクトル解析を用いて、プライバシー制約下での推定誤差の上限を求める。
実験結果
リサーチクエスチョン
- RQ1表現学習フェーズと分類器パーソナライゼーションを分離することで、フェデレーテッドラーニングにおけるプライバシーと有用性のトレードオフを改善できるか?
- RQ2グローバル表現の訓練とローカルパーソナライゼーションを分離することで、微分プライバシー下での勾配クリッピングの悪影響を軽減できるか?
- RQ3表現学習にのみプライバシー予算を集中させることで、先行のDP-FedAvgスタイル手法よりも、証明可能な優れた有用性を達成できるか?
- RQ4データ非同一性下で、微分プライバシー付きグローバル表現の理論的収束挙動はいかなるものか?
- RQ5固定されたプライバシー予算下で、入力次元dの増加に伴い、本手法の有用性向上はどのようにスケーリングするか?
主な発見
- 線形表現設定下で、Corollary 5.1で形式化されたように、CENTAURは先行研究と比較して√dの有用性向上を達成する。
- アルゴリズムは、プライバシー予算εに対してO(1/ε)の半径の球内へ線形収束する。
- CIFAR10、CIFAR100、EMNISTにおける実験的評価では、小さなプライバシー予算(ε=1、δ=10⁻⁵)下で、DP-FedAvg、PPSGD、PMTL-ft、DP-FedAvg-fbと比較して一貫した性能向上を示す。
- CIFAR10における異なるデータ非同一性設定下で、本手法はベースラインを一貫して上回り、耐障害性とスケーラビリティを示す。
- ノイズ付きパワー法のための交差検証スキームは、プライバシー制約下でのスペクトル推定の成功確率を顕著に向上させる。
- 理論的分析により、データ非同一性に起因する分類ヘッドの顕著な差異があっても、収束が維持されることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。