[論文レビュー] Privacy Regularization: Joint Privacy-Utility Optimization in Language Models
本稿では、言語モデルにおけるプライバシーと有用性の両立最適化のための2つのプライバシー正則化手法——識別器を用いた敵対的訓練および新しいトリプレット損失に基づく正則化子——を提案する。これらの手法は、微分プライバシーを上回り、より良いプライバシー・有用性トレードオフを達成するとともに、高速な学習と、代表されないユーザー集団への偏りの少ない影響を実現する。
Neural language models are known to have a high capacity for memorization of training samples. This may have serious privacy implications when training models on user content such as email correspondence. Differential privacy (DP), a popular choice to train models with privacy guarantees, comes with significant costs in terms of utility degradation and disparate impact on subgroups of users. In this work, we introduce two privacy-preserving regularization methods for training language models that enable joint optimization of utility and privacy through (1) the use of a discriminator and (2) the inclusion of a triplet-loss term. We compare our methods with DP through extensive evaluation. We show the advantages of our regularizers with favorable utility-privacy trade-off, faster training with the ability to tap into existing optimization approaches, and ensuring uniform treatment of under-represented subgroups.
研究の動機と目的
- メール文書におけるユーザーIDなどの機微な訓練データを言語モデルが記憶するリスクに対処する。
- 微分プライバシー(DP)学習に伴う顕著な有用性の低下と、代表されないユーザー集団への偏りの影響を克服する。
- 微分プライバシーが採用する一様なノイズ注入に依存しない、プライバシーとモデル有用性の共同最適化を可能にする正則化手法を開発する。
- 少ない訓練サンプルを持つユーザーの有用性損失の差を最小限に抑え、サブグループ間の差を是正することで、公平な扱いを確保する。
- 既存の最適化パイプラインと互換性があり、複雑なハイパーパrameterチューニングを避ける、スケーラブルで勾配ベースのDPの代替手法を提供する。
提案手法
- 言語モデルの最終隠れ状態から入力シーケンスの著者を識別するための識別器を訓練し、その予測結果を用いて、表現と機微な属性との間のリンク可能性を罰するプライバシー損失を計算する。
- 同じ著者からのシーケンスに対しては類似した表現を生成し、異なる著者間の表現を遠ざけるように促すトリプレット損失正則化子を導入する。これにより、著者リンク可能性が低減される。
- 標準的な言語モデリング損失に加え、プライバシー正則化損失を組み合わせた総合損失を最適化することで、標準的な最適化手法を用いたエンドツーエンドの学習を可能にする。
- プライバシー正則化のためのシーケンス埋め込みとして、RNNの最終隠れ状態(またはトランスフォーマーにおける[CLS]トークン)を用いる。これはGDPRが定義するリンク可能な情報と整合する。
- DP-SGDと同様に勾配クリッピングやノイズ注入を必要とせず、著者アイデンティティの記憶を防ぐために正則化子を学習中に適用する。
- 部分的なプロンプトから訓練シーケンスを再構築しようとするタブベースの再構築攻撃を用いてモデルを評価し、再構築精度を指標として成功度を測定する。
実験結果
リサーチクエスチョン
- RQ1プライバシー正則化手法は、微分プライバシーの高い有用性コストを負わずに、モデルインバージョン攻撃のリスクを低減できるか?
- RQ2異なるデータセットおよびパープレキシティレベルにおいて、提案手法の正則化子は微分プライバシーと比べて、プライバシー保護とモデル有用性の両面で優れているか?
- RQ3提案手法の正則化子は、微分プライバシー学習で観察された代表されないユーザー集団への偏りの影響を軽減できるか?
- RQ4標準的な最適化パイプラインを用いて、提案手法はDP-SGDの遅い収束やチューニングの複雑さを避けて、効率的に学習可能か?
- RQ5これらの正則化子を用いて学習されたモデルは、部分的なプロンプトを用いた再構築攻撃に対してどの程度耐性を示せるか?
主な発見
- 提案された正則化子は、微分プライバシーと同等またはそれ以上のプライバシー保護を達成しており、特に均一なノイズを適用するDPが相関性や繰り返しのあるシーケンスを十分に保護しない合成キャニーレの再構築において顕著な優位性を示す。
- 高パープレキシティモデルでは、合成キャニーレに対する再構築精度が低く抑えられるが、低パープレキシティモデルでは著しく上昇し、記憶の強度が高まっていることが示唆される。
- 提案手法で学習されたモデルは、微分プライバシーを上回り、特に記憶が生じやすい低パープレキシティ設定において、プライバシーと有用性の両面で優れた性能を発揮する。
- 提案手法では、代表されないユーザーと代表されるユーザーの間の有用性損失の差が7ポイントにとどまるのに対し、微分プライバシーでは29ポイントに達する。これは、著しい偏りの低減を示している。
- 正則化子は高速な学習を可能にし、標準的な最適化手法と互換性がある。これにより、DP-SGDが伴う計算コストとチューニングの負担を回避できる。
- 正則化子を用いて学習されたモデルは、タブベースの再構築攻撃に対して強靭であり、特に文法的パターンに従う実世界のキャニーレでは、微分プライバシーのモデルよりも攻撃成功確率が低くなる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。