Skip to main content
QUICK REVIEW

[論文レビュー] Training Data Leakage Analysis in Language Models

Huseyin A. Inan, Osman Ramadan|arXiv (Cornell University)|Jan 14, 2021
Privacy-Preserving Technologies in Data参考文献 45被引用数 22
ひとこと要約

この論文は、攻撃者が上位k個の予測結果のみにアクセス可能な強力なブラックボックス攻撃モデル下で、ユーザー単位のデータ漏洩を検出および定量化する手法を提案する。攻撃者が訓練データからの一意な文脈断片を再構築できる能力を測る2つの新しい指標を導入し、異なるモデル間でのプライバシー比較や、微分プライバシーおよびAPIハードニングなどの緩和策の評価を可能にする。

ABSTRACT

Recent advances in neural network based language models lead to successful deployments of such models, improving user experience in various applications. It has been demonstrated that strong performance of language models comes along with the ability to memorize rare training samples, which poses serious privacy threats in case the model is trained on confidential user content. In this work, we introduce a methodology that investigates identifying the user content in the training data that could be leaked under a strong and realistic threat model. We propose two metrics to quantify user-level data leakage by measuring a model's ability to produce unique sentence fragments within training data. Our metrics further enable comparing different models trained on the same data in terms of privacy. We demonstrate our approach through extensive numerical studies on both RNN and Transformer based models. We further illustrate how the proposed metrics can be utilized to investigate the efficacy of mitigations like differentially private training or API hardening.

研究の動機と目的

  • 機密性の高いユーザーコンテンツを学習データとして用いた言語モデルにおけるプライバシー漏洩リスクを調査すること。特に、希少または感受性の高いシーケンスの漏洩に焦点を当てる。
  • モデル開発者および導入者にとって実行可能であるような、ユーザー単位のプライバシー漏洩を定量化する課題に対処すること。
  • 同じデータで学習された異なるモデル(例:微分プライバシー付きモデルと通常のモデル)間でのプライバシー特性を公平に比較できる指標を開発すること。
  • 提案された指標を用いて、微分プライバシーやAPIハードニングなどのプライバシー保護技術の有効性を評価すること。
  • 実世界のシステムにおける言語モデルの導入ライフサイクル中に、プライバシー評価を実用的に行うフレームワークを提供すること。

提案手法

  • 攻撃者が与えられた入力プレフィックスに対して、モデルの上位k個のトークン予測のみにアクセス可能な、強力なブラックボックス攻撃モデルを定義する。
  • 訓練データからの文脈を段階的に提示することで、訓練データに含まれる一意な文脈断片を再構築するプローブ手順を設計する。
  • 2つの指標を導入する:(1) 与えられた文脈から一意な断片を回復する確率、および (2) 1つの文脈あたりに回復可能な一意な断片の平均数。
  • 実世界のデータセットを用いて、RNNおよびTransformerベースの言語モデルにこの手法を適用し、プライバシー漏洩を評価する。
  • 指標を用いて、微分プライバシーを適用したモデルとそうでないモデルを比較し、APIハードニングが漏洩に与える影響を評価する。
  • 指標を活用して、さまざまなモデルアーキテクチャおよびデータ分布におけるモデル挙動を分析し、特に希少または感受性の高い訓練シーケンスに注目する。

実験結果

リサーチクエスチョン

  • RQ1攻撃者が訓練データそのものからの文脈を提示した場合、言語モデルはどの程度、訓練データに含まれる一意な文脈断片を再構築できるか?
  • RQ2RNNとTransformerなどの異なるアーキテクチャにおいて、希少または感受性の高い訓練シーケンスの再構築能力はどのように異なるか?
  • RQ3微分プライバシーやAPIハードニングは、ユーザー単位のデータ漏洩の能力をどの程度低減できるか?
  • RQ4提案された指標は、同じデータセットで学習された異なるモデルのプライバシー特性を信頼性高く比較できるか?
  • RQ5現実的な攻撃モデル下で、モデルの記憶能力とユーザー再特定の可能性の間にはどのような関係があるか?

主な発見

  • 提案された指標は、言語モデルにおけるユーザー単位のデータ漏洩を効果的に定量化でき、微分プライバシーを適用したモデルとそうでないモデルとの間に明確な差が認められた。
  • 微分プライバシーを適用したモデルは、非プライベートなベースラインと比較して、一意な文脈断片の再構築能力が著しく低下しており、DPによる漏洩緩和効果が確認された。
  • 上位k個の予測結果のみにアクセス可能な強力なブラックボックス攻撃モデル下でも、多くのモデルが希少な訓練断片を再構築できることから、継続的なプライバシーリスクが存在することが示された。
  • フレームワークは、APIハードニング(上位k個の予測へのアクセス制限)により漏洩が軽減されるが、特に記憶能力が強いモデルでは完全に排除されないことが示された。
  • 指標の分析から、RNNとTransformerモデルは異なる漏洩パターンを示しており、特にTransformerは希少なシーケンスの記憶能力が高かった。
  • 従来の指標(例:exposure)はユーザー単位のプライバシー評価には不十分であることが確認された。提案された指標は、プライバシー漏洩リスクをより直接的かつ実行可能に測定できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。