[論文レビュー] Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks
本稿は、大規模言語モデル(LLMs)から機微な情報を真正に削除できるかを検証するもので、モデル重みを直接編集することで実現可能かどうかを検討し、新たな攻撃・防御フレームワークを提案する。Rome や MEMIT といった最先端の編集手法でさえも、38–89% の割合で削除された事実が回復可能であることが判明し、隠れ状態や質問の再表現に残存する痕跡が削除の有効性を損なうことが明らかになった。これは、プライバシー保護に配慮した堅牢なモデル編集を達成することが極めて困難であることを示している。
Pretrained language models sometimes possess knowledge that we do not wish them to, including memorized personal information and knowledge that could be used to harm people. They can also output toxic or harmful text. To mitigate these safety and informational issues, we propose an attack-and-defense framework for studying the task of deleting sensitive information directly from model weights. We study direct edits to model weights because (1) this approach should guarantee that particular deleted information is never extracted by future prompt attacks, and (2) it should protect against whitebox attacks, which is necessary for making claims about safety/privacy in a setting where publicly available model weights could be used to elicit sensitive information. Our threat model assumes that an attack succeeds if the answer to a sensitive question is located among a set of B generated candidates, based on scenarios where the information would be insecure if the answer is among B candidates. Experimentally, we show that even state-of-the-art model editing methods such as ROME struggle to truly delete factual information from models like GPT-J, as our whitebox and blackbox attacks can recover "deleted" information from an edited model 38% of the time. These attacks leverage two key observations: (1) that traces of deleted information can be found in intermediate model hidden states, and (2) that applying an editing method for one question may not delete information across rephrased versions of the question. Finally, we provide new defense methods that protect against some extraction attacks, but we do not find a single universally effective defense method. Our results suggest that truly deleting sensitive information is a tractable but difficult problem, since even relatively low attack success rates have potentially severe societal implications for real-world deployment of language models.
研究の動機と目的
- LLM から個人情報や有害な知識を含む機微な情報を信頼性高く削除する必要性に対応し、プライバシー権および安全性を支援すること。
- 攻撃が削除された事実が小さな候補集合 B の中で回収可能である場合に成功と定義する、現実世界の攻撃シナリオを反映したきめ細やかな脅威モデルを構築すること。
- 強化学習によるヒューリスティックフィネーティング(RLHF)やデータレベルの介入とは異なり、重みを直接編集することで情報を削除する方法が、実用的かつ安全な代替手段であるかどうかを評価すること。
- 意図された攻撃に加え、予期しない抽出攻撃、特にホワイトボックスプローブ攻撃に対しても、提案された防御策の耐性を検証すること。
- 先進的な編集手法ですら完全に情報を消去できないことが示され、モデルのプライバシーと安全性に関する仮定に疑問を呈すること。
提案手法
- 機微な事実情報の削除におけるモデル編集の有効性を検証するための二重攻撃・防御フレームワークを提案する。
- 隠れ状態やアテンションヘッドに残存する情報を利用する2つのホワイトボックス攻撃を設計:ヘッドプロジェクション攻撃と確率差分攻撃。
- 削除された質問の再表現を用いてモデルにクエリを送ることで、削除の一般化性を検証するブラックボックス攻撃を提案する。
- 事実の消去、空の応答のインジェクション、エラーのインジェクション、ヘッドプロジェクション、最大エントロピー正則化、およびIRベースの防御を含む複数の防御戦略を採用し、モデル重みの耐性強化を図る。
- ターゲットモデルとして GPT-J を採用し、CounterFact および zsRE データセットで評価を行い、B 候補の中での回収率を用いて攻撃の成功率を測定する。
- 攻撃成功の定義を、小さな応答候補集合 B から正しい答えを回収できた場合とし、現実の攻撃設定を模倣する脅威モデルを適用する。
実験結果
リサーチクエスチョン
- RQ1現在のモデル編集技術を用いて、LLM の重みから機微な事実情報を信頼性高く削除できるか?
- RQ2ホワイトボックスおよびブラックボックス抽出攻撃は、削除されたはずの情報をどの程度回収可能か?
- RQ3提案された防御メカニズムは、意図された攻撃および予期しない抽出攻撃の両方に対してどの程度効果的か?
- RQ4隠れ状態やアテンションヘッドに残存する情報が、編集による削除の有効性を損なう要因となるか?
- RQ5部分的な削除が、LLM の展開におけるプライバシー、安全性、およびデータ所有権の遵守に与える影響は何か?
主な発見
- Rome や MEMIT といった最先端の編集手法ですら、確率差分攻撃において最大 89.65% の割合で削除された事実が回収可能であり、事実の完全な削除に失敗していることが判明した。
- ヘッドプロジェクション攻撃は、IR 防御に対して 84.80%、ヘッドプロジェクション防御に対して 56.83% の成功率を示し、防御策が普遍的に堅牢ではないことが示された。
- 最大エントロピー防御はホワイトボックス攻撃の成功率を ROME で 2.42%、MEMIT で 38.11% まで低下させたが、ブラックボックス攻撃では CounterFact で 28.00%、zsRE で 19.42% の成功率を示し、依然として脆弱性が残存していることが判明した。
- 最大エントロピー防御を狙った攻撃ではないが、確率差分攻撃は同防御に対して 2.42% の成功率を示し、一部の防御が予期しない攻撃に対しても偶然的保護を提供することが示された。
- 空の応答インジェクション防御は、ROME を用いた zsRE では攻撃ブロッキングに 99.78% の成功率を示したが、MEMIT では 88.55% の成功率を示し、一般化に失敗していることが判明した。
- どの防御手法もすべての攻撃に対して有効ではなく、最良の防御でも依然として顕著な回収率が残っており、真正な削除は依然として困難な課題であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。