Skip to main content
QUICK REVIEW

[論文レビュー] One-shot Empirical Privacy Estimation for Federated Learning

Galen Andrew, Peter Kairouz|arXiv (Cornell University)|Feb 6, 2023
Privacy-Preserving Technologies in Data被引用数 6
ひとこと要約

本稿では、再訓練やモデルアーキテクチャ、データ、DPアルゴリズムに関する事前知識が不要な、フェデレーテッドラーニングにおける1回の学習実行でのユーザー単位の微分プライバシー(DP)エプシロン推定を可能にするワンショット実験的プライバシー推定手法を提案する。複数のキャニオンクライアントをランダムな更新とともに挿入することで、ガウス機構におけるプライバシー損失を保証された正しさと最小限の計算コストで効率的に推定でき、再訓練を必要としない従来のマルチラン手法に比べ、精度と効率性に優れる。

ABSTRACT

Privacy estimation techniques for differentially private (DP) algorithms are useful for comparing against analytical bounds, or to empirically measure privacy loss in settings where known analytical bounds are not tight. However, existing privacy auditing techniques usually make strong assumptions on the adversary (e.g., knowledge of intermediate model iterates or the training data distribution), are tailored to specific tasks, model architectures, or DP algorithm, and/or require retraining the model many times (typically on the order of thousands). These shortcomings make deploying such techniques at scale difficult in practice, especially in federated settings where model training can take days or weeks. In this work, we present a novel "one-shot" approach that can systematically address these challenges, allowing efficient auditing or estimation of the privacy loss of a model during the same, single training run used to fit model parameters, and without requiring any a priori knowledge about the model architecture, task, or DP training algorithm. We show that our method provides provably correct estimates for the privacy loss under the Gaussian mechanism, and we demonstrate its performance on well-established FL benchmark datasets under several adversarial threat models.

研究の動機と目的

  • フェデレーテッドラーニングにおける既存のプライバシー監査技術が、数千回の再訓練と攻撃者やモデルに関する強い仮定を必要とするというスケーラビリティと実用性の制限を是正すること。
  • モデルアーキテクチャ、タスク、データ分布に関する事前知識がなくても、フェデレーテッドラーニングにおける効率的で1回の学習ランでのプライバシー推定を可能にすること。
  • 非i.i.d.データや限られたクライアント参加がある複雑な現実世界のFL設定においても、ガウス機構下でのプライバシー損失を保証された正しさで推定できること。
  • タスク、モデル、データセットに依存しない一般用途のモデルに依存しない手法として、カスタマイズや高価なキャニオン作成が不要な、多様なFLアプリケーションに適用可能であること。

提案手法

  • 各クライアントの貢献を模倣するように設計されたランダムなモデル更新を持つ、複数の独立したキャニオンクライアントをフェデレーテッド学習プロセスに挿入する。
  • 最終モデルと各キャニオンの更新とのドット積を用いて、メンバーインファレンスの尤度を推定し、プライバシー損失の代理指標を構築する。
  • すべてのキャニオンに対してこれらのドット積の分布を分析することで、ガウス機構の統計的性質を活用してプライバシーパラメータεを推定する。
  • 反復的な再訓練を回避するワンショット推定フレームワークを適用し、モデル最適化に使用される同じ学習ラン中にプライバシー監査を可能にする。
  • 異なる学習ダイナミクスにおいてもε推定の堅牢性と一貫性を検証するために、既知のものと未知のキャニオンを併用する。
  • モデル固有やデータ固有のキャニオン作成を避けることで、最小限の計算コストを確保し、タスク、モデル、データセットに依存しない方法とする。

実験結果

リサーチクエスチョン

  • RQ1再訓練が不要な1回の学習ランを用いて、フェデレーテッドラーニングにおけるユーザー単位の微分プライバシーを実験的に推定できるか?
  • RQ2提案手法のワンショット法は、従来のマルチランプライバシー監査手法と比較して、精度と効率性においてどのように異なるか?
  • RQ3キャニオン数が変化する場合や、理想的な仮定から逸脱する学習ダイナミクスにおいて、この手法はどの程度堅牢性を保つのか?
  • RQ4解析的境界が存在しない状況でも、非i.i.d.データ、非一様なクライアントサンプリング、非等方的ノイズによるプライバシー漏洩を検出できるか?
  • RQ5解析的境界が緩やかまたは存在しない状況において、この手法のε推定値は真のプライバシー損失とどの程度一致するのか?

主な発見

  • 制御された環境下で、本手法はCANIFE手法(0.879)よりも解析的ε境界(例:6.76 vs. 34.5)にはるかに近い推定値を提示し、優れた精度を示した。
  • 1回のランで1000個のキャニオンを使用した場合、100個のキャニオンを10回のランで使用した場合とほぼ同一のプライバシー推定値を達成し、キャニオン数の変動に対しても一貫性と堅牢性を示した。
  • 50回の実験におけるε推定値の分布は安定的で、非常に集中しており、ノイズ乗数やキャニオン設定の変更に対しても最小限のばらつきを示した。
  • 学習プロセスが理想的なi.i.d.仮定から逸脱しても、ガウス機構下で保証された正しさを持つ推定が可能であることを示した。
  • モデル固有やデータ固有のキャニオン作成が不要であり、計算コストも最小限に抑えられ、さまざまなFLシステムへの広範な適用性を有する。
  • StackOverflowおよびファッションMNISTデータセットにおける実験結果から、モデルの有用性を損なわず、信頼性の高い1回の実行でのプライバシー推定が可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。