Skip to main content
QUICK REVIEW

[論文レビュー] Are Large Pre-Trained Language Models Leaking Your Personal Information?

Jie Huang, Hanyin Shao|arXiv (Cornell University)|May 25, 2022
Privacy-Preserving Technologies in Data被引用数 8
ひとこと要約

この論文は、大規模事前学習言語モデル(PLM)が、記憶(データの保持)と関連付け(所有者とのリンク)を区別することによって、個人情報、特にメールアドレスを漏洩するかどうかを調査している。研究では、PLMが個人情報を記憶することは確認されたが、所有者との関連付けが弱いため、標的型のプライバシー漏洩のリスクは顕著に低減しており、現在のモデルは相対的に安全であるものの、完全にリスクフリーではないことが示された。

ABSTRACT

Are Large Pre-Trained Language Models Leaking Your Personal Information? In this paper, we analyze whether Pre-Trained Language Models (PLMs) are prone to leaking personal information. Specifically, we query PLMs for email addresses with contexts of the email address or prompts containing the owner's name. We find that PLMs do leak personal information due to memorization. However, since the models are weak at association, the risk of specific personal information being extracted by attackers is low. We hope this work could help the community to better understand the privacy risk of PLMs and bring new insights to make PLMs safe.

研究の動機と目的

  • 大規模事前学習言語モデル(PLM)が、メールアドレスのような個人情報を漏洩するかどうかを評価すること。
  • 記憶(データの保持)と関連付け(所有者とのリンク)を別々のプライバシーリスクとして区別すること。
  • 所有者の名前をプロンプトとして使用することで、攻撃者がPLMから特定の個人情報を抽出できるかどうかの実世界のリスクを評価すること。
  • PLMにおけるプライバシー漏洩を軽減するための実用的対策を提示すること。
  • 研究者が自らのモデルを公開する前にプライバシーリスクを評価するのを支援する指針を提供すること。

提案手法

  • 著者は、所有者の名前や文脈的手がかりを含むプロンプトを用いてPLMに問い合わせ、モデルが特定のメールアドレスを生成できるかどうかをテストした。
  • 記憶は、訓練データからの文脈が提示された際にモデルが個人メールを出力できる能力として定義・測定した。
  • 関連付けは、訓練データにアクセスしない状態で所有者の名前が提示された際に、モデルが個人メールを出力できる能力として定義・測定した。
  • 実験は、GPT-3(text-davinci-2)やGPT-Neoなどの公開済みモデルを対象とし、個人情報の源としてEnron Email Datasetを用いた。
  • 攻撃の成功率は、さまざまなプロンプトパターンやモデルサイズの下で、モデルが正しいメールをどれだけの頻度で出力するかを測定することで評価した。
  • 微分プライバシー訓練、ポストプロセッシングフィルタ、画像ベースのメール表示によるごまかし技術などの防御戦略を提案した。

実験結果

リサーチクエスチョン

  • RQ1事前学習言語モデルは、メールアドレスのような個人情報をどの程度記憶するのか?
  • RQ2攻撃者が所有者の名前をプロンプトとして使用することで、特定の個人情報を効果的に抽出できるのか?
  • RQ3モデルが個人情報を所有者と関連付ける能力が、プライバシー漏洩のリスクにどのように影響するのか?
  • RQ4プロンプトパターン、モデルサイズ、事前の知識などの要因が、こうした攻撃の成功率をどのように高めるのか?
  • RQ5PLMからの個人情報漏洩リスクを低減する実用的防御策は何か?

主な発見

  • 大規模事前学習言語モデルは、メールアドレスのような個人情報を記憶しており、機密データがモデルパラメータに保持されることを確認した。
  • 所有者の名前のみを用いて特定のメールを抽出する攻撃の成功率は低く、PLMの関連付け能力が弱いことが示された。
  • より長く、より具体的なプロンプトパターンは攻撃成功率を顕著に向上させ、文脈が漏洩の可能性を高めることを示唆した。
  • より大きなモデルでは、個人情報の漏洩成功率が高くなる傾向にあり、スケーリングが記憶リスクを拡大することを示した。
  • 関連付け能力が低いことから、標的型プライバシー漏洩のリスクは低いが、記憶そのものが依然として顕著なプライバシー脅威を引き起こす。
  • 微分プライバシー訓練、ポストプロセッシングフィルタ、メールのごまかし技術などの防御戦略は、漏洩リスクを効果的に低減できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。