Skip to main content
QUICK REVIEW

[論文レビュー] Unleashing the Power of Randomization in Auditing Differentially Private ML

Krishna Pillutla, Galen Andrew|arXiv (Cornell University)|May 29, 2023
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

この論文は、ランダム化キャニーレイと交換可能な検定統計量を活用することで、最大16倍のサンプル効率向上を達成する、微分プライバシー機械学習のための新規監査フレームワークを提案する。Lifted Differential Privacy (LiDP) と、実証的相関を活用する適応的信頼区間を提案することで、各プライベートに訓練されたモデルを複数の仮説検定に再利用でき、プライバシー保証を監査するためのモデル再訓練回数を顕著に削減する。

ABSTRACT

We present a rigorous methodology for auditing differentially private machine learning algorithms by adding multiple carefully designed examples called canaries. We take a first principles approach based on three key components. First, we introduce Lifted Differential Privacy (LiDP) that expands the definition of differential privacy to handle randomized datasets. This gives us the freedom to design randomized canaries. Second, we audit LiDP by trying to distinguish between the model trained with $K$ canaries versus $K - 1$ canaries in the dataset, leaving one canary out. By drawing the canaries i.i.d., LiDP can leverage the symmetry in the design and reuse each privately trained model to run multiple statistical tests, one for each canary. Third, we introduce novel confidence intervals that take advantage of the multiple test statistics by adapting to the empirical higher-order correlations. Together, this new recipe demonstrates significant improvements in sample complexity, both theoretically and empirically, using synthetic and real data. Further, recent advances in designing stronger canaries can be readily incorporated into the new framework.

研究の動機と目的

  • 微分プライバシー機械学習モデルの監査にかかる高い計算コストを軽減すること、これはしばしば数千回に及ぶモデル再訓練を要する。
  • 独立したベルヌーイ試行に基づく標準監査手法の根本的な $1/\sqrt{n}$ サンプル複雑性の限界を克服すること。
  • 対称性とランダム化を活用して、プライベートに訓練されたモデルを複数の仮説検定に効率的に再利用できる、原則的フレームワークを構築すること。
  • 実証的高次相関を考慮する適応的信頼区間を設計し、統計的パワーを向上させること。
  • 高度なキャニーレイ設計をより効率的な監査パイプラインにシームレスに統合できること。

提案手法

  • ランダム化データセットとリジェクトセットを許容するDPの拡張定義として、Lifted Differential Privacy (LiDP) を導入し、ランダムキャニーレイの使用を可能にする。
  • 訓練セットに $K > 1$ 個のi.i.d.ランダムキャニーレイを追加し、$K$ 個のキャニーレイで訓練したモデルと、$K-1$ 個で訓練したモデルを比較する監査プロトコルを設計する。
  • i.i.d.キャニーレイによる検定統計量の交換可能性を活用し、各プライベートに訓練されたモデルを $K$ 個の異なる仮説検定に再利用することで、$K$ 回の別々の再訓練を回避する。
  • 交換可能なベルヌーイ確率変数のための新しい適応的信頼区間の族を提案し、実証的高次相関を考慮することで、標準区間よりも精度を向上させる。
  • テスト統計量をモデル化するための eXchangeable Bernoulli (XBern) 分布を用い、独立またはi.i.d.仮定よりもタイトな信頼区間を導出する。
  • データポisonsやランダム勾配キャニーレイなどの先進的なキャニーレイ設計を、新しいフレームワークに統合し、検出感度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1微分プライバシー機械学習モデルの監査において、$1/\sqrt{n}$ サンプル複雑性の壁を破ることが可能か?
  • RQ2統計的妥当性を損なわせることなく、各プライベートに訓練されたモデルを複数の仮説検定に再利用できる監査フレームワークをどのように設計できるか?
  • RQ3テスト統計量間の実証的高次相関が、プライバシー監査の精度に与える影響は何か?
  • RQ4標準のキャニーレイベース監査手法を、ランダム化されi.i.d.なキャニーレイを用いるように拡張でき、効率性を維持または向上できるか?
  • RQ5実証的相関に基づく適応的信頼区間は、標準区間と比較して、サンプル効率性および正確性の点でどのように異なるか?

主な発見

  • 提案手法は、合成および実データセット上で理論的・実験的に、標準監査手法と比較して最大16倍のサンプル複雑性の向上を達成する。
  • i.i.d.ランダムキャニーレイの使用により、テスト統計量の交換可能性が実現され、各プライベートに訓練されたモデルが $K$ 個の異なる仮説検定に再利用可能になる。
  • 実証的高次相関を考慮する適応的信頼区間は、標準区間よりも顕著にタイトな境界を提供するが、特に実際の依存性が低い場合に顕著に効果を発揮する。
  • 本フレームワークは、データポisonsやランダム勾配キャニーレイなどの高度なキャニーレイ設計のシームレスな統合をサポートし、検出感度を向上させる。
  • 実験結果から、複数のキャニーレイを追加してもモデルのテスト精度が低下しないことが確認され、監査プロセスが非干渉的であることが裏付けられた。
  • 2番目の順序のウィルソン区間が、強力な性能と実装の容易さから、デフォルトとして推奨される。これは、全テスト $ε$ 値において4番目の順序バージョンを上回るか、同等の性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。