Skip to main content
QUICK REVIEW

[論文レビュー] Have it your way: Individualized Privacy Assignment for DP-SGD

Franziska Boenisch, Christopher Mühl|arXiv (Cornell University)|Mar 29, 2023
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本稿では、個々の学習データポイントに個別のプライバシー予算を割り当てることで、パーソナライズされたプライバシー保護を可能にする、プライバシー保護付き確率的勾配降下法(DP-SGD)の新規変種であるIndividualized DP-SGD(IDP-SGD)を提案する。データのサンプリングおよび勾配ノイズスケーリングのメカニズムを変更することで、理論的なプライバシー保証を損なわずにプライバシーと有用性のトレードオフを改善し、視覚および自然言語のベンチマークで多様なプライバシー志向の分布を持つ状況において顕著な有用性の向上を示した。

ABSTRACT

When training a machine learning model with differential privacy, one sets a privacy budget. This budget represents a maximal privacy violation that any user is willing to face by contributing their data to the training set. We argue that this approach is limited because different users may have different privacy expectations. Thus, setting a uniform privacy budget across all points may be overly conservative for some users or, conversely, not sufficiently protective for others. In this paper, we capture these preferences through individualized privacy budgets. To demonstrate their practicality, we introduce a variant of Differentially Private Stochastic Gradient Descent (DP-SGD) which supports such individualized budgets. DP-SGD is the canonical approach to training models with differential privacy. We modify its data sampling and gradient noising mechanisms to arrive at our approach, which we call Individualized DP-SGD (IDP-SGD). Because IDP-SGD provides privacy guarantees tailored to the preferences of individual users and their data points, we find it empirically improves privacy-utility trade-offs.

研究の動機と目的

  • DP-SGDにおける均一なプライバシー予算の制限を是正すること。これは、すべてのユーザーが同一のプライバシー志向を持つと仮定しているが、現実の多様なプライバシー期待とは一致しない。
  • 機械学習の学習にデータを貢献する際、個人が自身の望むプライバシー保護レベルを指定できるようにすること。
  • 個別のプライバシー予算をサポートしながらもエンドツーエンドの微分プライバシー保証を維持する、実用的かつ理論的に整合性のあるDP-SGDの拡張を構築すること。
  • 多様なデータセットおよびモデルアーキテクチャにおいて、個別化された予算割り当ての有用性とプライバシーのトレードオフを経験的に評価すること。

提案手法

  • 各データポイントの個別のプライバシー予算に比例して選択されるように変更されたデータサンプリング手法(Sample)を導入。これにより、より高いプライバシー保護が求められるデータが頻繁に使用されるようになる。
  • 各データポイントごとにノイズスケールを調整する個別化されたノイズスケーリング手法(Scale)を提案。バッチレベルでのノイズ追加フレームワーク内でのポイント単位のプライバシー予算化を可能にするために、クリッピングノルム乗数を変更する。
  • 理論的分析により、両手法が個別化されたプライバシーパラメータ(εp, δ)を保持する微分プライバシーを満たすことが示された。これにより、各データポイントのプライバシー予算が尊重される。
  • RDP(Rényi微分プライバシー)分析を用いてプライバシー境界を導出し、標準的な変換技術を用いて個別グループレベルのRDPパラメータを(εp, δ)-DP保証に変換する。
  • 学習開始前に最適なサンプリングレートおよびノイズ乗数を設定するための事前学習設定ステップ(アルゴリズム2および3)を採用する。
  • 各プライバシーグループを並列に動作する独立したサブサンプルド・ガウス機構として扱い、個々のプライバシーパラメータを有する。これにより、グループ間でプライバシーコストが線形に累積される。

実験結果

リサーチクエスチョン

  • RQ1均一な予算割り当てと比較して、個別化されたプライバシー予算はDP-SGDにおけるプライバシーと有用性のトレードオフを改善できるか?
  • RQ2個々の学習ポイントに異なるプライバシー予算を割り当てる場合、微分プライバシーはどのように保たれるか?
  • RQ3個別化されたサンプリングおよびノイズスケーリングをサポートするように変更されたDP-SGDの理論的プライバシー保証は何か?
  • RQ4ユーザー間のプライバシー志向の分布が異なる場合、IDP-SGDの性能はどのように変化するか?
  • RQ5標準的なDP-SGDフレームワーク内に、トレーニング効率を損なわずに効率的に実装できるか?

主な発見

  • IDP-SGDは、高いプライバシー志向を持つユーザーに対して強い予算を割り当て、低いプライバシー志向のユーザーに対してはノイズを減らすことで、モデルの精度向上を実現し、プライバシーと有用性のトレードオフを改善する。
  • 理論的分析により、SampleおよびScaleの両メカニズムが個別化された(εp, δ)-微分プライバシーを満たすことが確認され、プライバシーコストがプライバシーグループ間で線形に累積される。
  • 視覚および自然言語のデータセットにおける経験的評価では、プライバシー志向の分布が不均一な場合に、複数のモデルアーキテクチャで一貫した有用性の向上が得られた。
  • 一部のユーザーが極めて低いプライバシー耐性を持つ場合でも、全体のシステムが最も弱いプライバシー予算を侵害しないように保証するため、強いプライバシー保証を維持している。
  • 提案されたメカニズムは、例ごとのノイズ追加ではなくクリッピングノルムの調整によりノイズスケーリングを実現するため、標準的なDP-SGD実装と効率的に互換性がある。
  • 結果は、プライバシー志向が偏っている場合に、個別化された予算割り当てが、モデル精度の低下を招く低関心データポイントの過剰保護を回避する点で特に有益であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。