[論文レビュー] Hyperparameter Tuning with Renyi Differential Privacy
本稿では、反復的モデル最適化中のプライバシー漏洩を制限するために、Rényi微分プライバシー(RDP)を用いた、差分プライバシーなハイパーパramータチューニングフレームワークを提案する。ランダムに選ばれた訓練実行回数をサンプリングし、最も良いモデルを選択することで、プライバシー保証が実行回数に対して対数的に増加する。これは線形合成境界に比べて顕著に改善され、プライバシー損失を犠牲にすることなくプライベートなモデル選択を可能にする。
For many differentially private algorithms, such as the prominent noisy stochastic gradient descent (DP-SGD), the analysis needed to bound the privacy leakage of a single training run is well understood. However, few studies have reasoned about the privacy leakage resulting from the multiple training runs needed to fine tune the value of the training algorithm's hyperparameters. In this work, we first illustrate how simply setting hyperparameters based on non-private training runs can leak private information. Motivated by this observation, we then provide privacy guarantees for hyperparameter search procedures within the framework of Renyi Differential Privacy. Our results improve and extend the work of Liu and Talwar (STOC 2019). Our analysis supports our previous observation that tuning hyperparameters does indeed leak private information, but we prove that, under certain assumptions, this leakage is modest, as long as each candidate training run needed to select hyperparameters is itself differentially private.
研究の動機と目的
- 差分プライバシー訓練アルゴリズム(例:DP-SGD)を用いる際、ハイパーパramータチューニングにおける見過ごされがちなプライバシーリスクに対処すること。
- 非プライベートなチューニング手順を通じて、ハイパーパramータ選択が個人のプライベート情報を漏洩させることを形式的に特定すること。
- Rényi微分プライバシー(RDP)の下で強いプライバシー保証を維持する、プライバシー保護型ハイパーパramータサーチメカニズムを開発すること。
- 従来の研究を改善し、訓練実行回数に伴うプライバシー損失の境界を線形ではなく対数的に増加させる手法を達成すること。
- 切り捨てられたランダムな繰り返しによる訓練実行を用いて、差分プライバシーなモデル選択を実用的かつ解析的に妥当な方法で提供すること。
提案手法
- プライバシー漏洩を制御するために、切り捨て閾値を持つ分布から抽出されるランダムな訓練実行回数を用いる。
- 全体のハイパーパramータチューニングプロセスのプライバシー損失を分析するために、Rényi微分プライバシー(RDP)を適用し、従来のDPに比べてよりタイトな境界を得る。
- プライバシーコストを制御するために、訓練実行回数を切り捨て点mに条件づける。これにより、高値の期待実行回数が小さくなる。
- 確率生成関数(PGF)およびその導関数を用いて、隣接データセット間のプライバシー損失を比較する一般的なプライバシー境界を導出する。
- 後処理不変性およびRényi発散を用いて、複数のプライベートな実行から最良のモデルを選択する際のプライバシー損失を境界付ける。
- 分布の尾部挙動に依存するよりタイトなプライバシー境界を可能にする、訓練実行回数の切り捨て分布を導入する。
実験結果
リサーチクエスチョン
- RQ1非プライベートなモデル評価に基づくハイパーパramータチューニングは、訓練データ内の個人に関するプライベート情報を漏洩させる可能性があるか?
- RQ2複数の差分プライベートな訓練実行から最良のモデルを選択する際のプライバシーコストは何か?
- RQ3訓練実行回数に伴い、プライバシー保証が非線形的に増加するハイパーパramータチューニングを達成できるか?
- RQ4プライバシーを強力に保ちながら、ユーティリティ損失を最小限に抑えるハイパーパramータチューニング手順をどのように設計できるか?
- RQ5ランダムハイパーパramータサーチにおけるプライバシーパラメータと訓練実行回数の尾部の重さの間には、どのようなトレードオフがあるか?
主な発見
- 非プライベートな訓練実行に基づくハイパーパramータチューニングは、訓練データ内の外れ値が最適ハイパーパramータに顕著に影響を与える場合、プライベート情報を漏洩させる可能性がある。
- ランダムな訓練実行回数を用いる場合、複数の差分プライベートな訓練実行から最良のモデルを選択する際のプライバシーコストは、実行回数に伴い対数的に増加するが、線形ではなくなる。
- 十分に小さな切り捨て点を用いた幾何分布を用いることで、実行回数に依存しないプライバシー保証が達成される。
- 特に大きな実行回数の確率が小さい場合、標準的な合成定理に比べて、導出されたプライバシー損失境界は定量的にタイトである。
- フレームワークは、近似DPに緩和することなく、プライベートなハイパーパラメータチューニングを可能にする。
- 切り捨て閾値を超える期待実行回数が小さい場合、導出された境界は有効である。これは、十分に大きな切り捨て値に対して成立する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。