[論文レビュー] Quantifying Privacy Risks of Masked Language Models Using Membership Inference Attacks
本稿では、マスクド言語モデル(MLM)におけるプライバシーリスクを定量化するため、尤度比に基づくメンバーインファレンス攻撃を提案する。参照用MLMを用いることで、学習データに記憶されたデータの検出を向上させる。従来の損失のみに依存する手法とは異なり、臨床用MLMではAUC 0.90を達成し、以前の最先端手法のAUC 0.66を著しく上回った。これは、MLMが記憶によるプライバシー漏洩に対して極めて感受性が高いことを示している。
The wide adoption and application of Masked language models~(MLMs) on sensitive data (from legal to medical) necessitates a thorough quantitative investigation into their privacy vulnerabilities -- to what extent do MLMs leak information about their training data? Prior attempts at measuring leakage of MLMs via membership inference attacks have been inconclusive, implying the potential robustness of MLMs to privacy attacks. In this work, we posit that prior attempts were inconclusive because they based their attack solely on the MLM's model score. We devise a stronger membership inference attack based on likelihood ratio hypothesis testing that involves an additional reference MLM to more accurately quantify the privacy risks of memorization in MLMs. We show that masked language models are extremely susceptible to likelihood ratio membership inference attacks: Our empirical results, on models trained on medical notes, show that our attack improves the AUC of prior membership inference attacks from 0.66 to an alarmingly high 0.90 level, with a significant improvement in the low-error region: at 1% false positive rate, our attack is 51X more powerful than prior work.
研究の動機と目的
- マスクド言語モデル(MLM)に対する従来のメンバーインファレンス攻撃が単にモデル損失に依存しており、内在的なサンプルの複雑さと真の記憶の区別がつかなかったことによる、曖昧な結果を是正すること。
- サンプルの複雑さによる混同要因を低減するため、参照用MLMを用いて尤度比をキャリブレーションすることで、より正確なメンバーインファレンス攻撃を構築すること。
- 臨床ノートなどの機密データを学習に用いたMLMにおける記憶の程度を、原則的な統計的仮説検定を用いて実証的に定量化すること。
- メンバーインファレンス攻撃に対して脆弱性が高まるデータ特徴(例:句読点の密度)を同定すること。
- MLMにおけるプライバシーリスクを監査するフレームワークを提供し、耐性のあるプライバシー保護型学習手法の設計を支援すること。
提案手法
- 攻撃は、ターゲットMLMと、元のデータ分布に基づいて学習された参照MLMとの間で尤度比仮説検定を実行し、サンプルが訓練データに属する可能性を評価する。
- MLMをエネルギーベース確率モデルとして扱い、非確率的性質にもかかわらずエネルギー関数を用いてシーケンス確率を推定することで、尤度の計算を可能にする。
- 尤度比は、ターゲットモデル下でのサンプルの確率を参照モデル下での確率で割ったものであり、キャリブレーションされた検定統計量を提供する。
- 攻撃は、MIMIC-IIIおよびi2b2の医療ノートデータセットで微調整されたClinicalBERT-Baseモデルを対象とし、AUCおよび固定された偽陽性率における真正陽性率を指標として評価する。
- 参照モデルは、ターゲットモデルの学習データとは重複しないが、分布的に類似したデータサブセットを用いて学習させ、人口分布を反映しつつ、ターゲットモデルの訓練データを記憶しないようにする。
- フレームワークは、モデルサイズ、シーケンス長、およびデータ特徴(例:句読点)が攻撃成功に与える影響を分析するために適用された。
実験結果
リサーチクエスチョン
- RQ1マスクド言語モデルはどの程度個々の訓練サンプルを記憶しているのか。また、モデル損失に依存するのではなく、どのようにしてその記憶を正確に測定できるのか。
- RQ2参照モデルを用いた尤度比検定は、損失ベースのベースラインと比較して、MLMにおけるメンバーインファレンス攻撃の性能を顕著に向上させることができるか。
- RQ3長さ、句読点、複雑さなどのデータ特徴のうち、MLMにおけるメンバーインファレンス攻撃に対して脆弱性が高まるものは何か。
- RQ4モデルサイズおよびシーケンス長は、MLMにおける尤度比ベースのメンバーインファレンス攻撃の成功にどのように影響を与えるか。
- RQ5これらの発見は、臨床ノートなどの機密データを微調整に用いたMLMにおけるプライバシーにどのような意味を持つのか。
主な発見
- 提案された尤度比ベースのメンバーインファレンス攻撃は、MIMIC-IIIで微調整されたClinicalBERT-BaseモデルでAUC 0.90を達成した。これは、従来の損失ベース手法(AUC 0.66)と比較して顕著な向上を示している。
- 偽陽性率10%の条件下で、攻撃の真正陽性率は79.2%に達したが、ベースライン手法ではわずか15.6%にとどまり、検出能力の著しい向上が確認された。
- 低誤差領域(偽陽性率1%)では、攻撃は従来の損失ベース手法の51倍も強力であることが判明し、検出が難しいサンプルに対しても効果的であることが示された。
- 複数の非アルファベット・数字文字(例:句読点)を含むサンプルは、記憶の影響を強く受ける傾向にあり、結果としてメンバーインファレンス攻撃に対してより脆弱である。
- 本研究では、機密データを学習に用いたMLMが、プライバシー漏洩に対して極めて感受性が高いことが示された。これは、従来のアーカイブ型モデルよりプライバシー保護が優れているとされる主張とは矛盾する。
- これらの結果は、個々のデータレコードを保護するため、微分プライバシーなどのプライバシー保護型学習技術の導入が急務であることを強調している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。