[論文レビュー] The Janus Interface: How Fine-Tuning in Large Language Models Amplifies the Privacy Risks
本論文は、大規模言語モデル(LLM)におけるファインチューニングの仕組みを悪用することで、以前に隠されていた個人識別情報(PII)を回復・公開する、新しい攻撃手法「Janus攻撃」を紹介する。GPT-3.5をわずか10件のPII例にファインチューニングするだけで、隠されたメールアドレスの回復精度が69.9%に達し、ファインチューニングが深刻な忘却(catastrophic forgetting)を逆転させ、アライメント保護メカニズムにもかかわらず個人情報の露呈を可能にすることを示している。
The rapid advancements of large language models (LLMs) have raised public concerns about the privacy leakage of personally identifiable information (PII) within their extensive training datasets. Recent studies have demonstrated that an adversary could extract highly sensitive privacy data from the training data of LLMs with carefully designed prompts. However, these attacks suffer from the model's tendency to hallucinate and catastrophic forgetting (CF) in the pre-training stage, rendering the veracity of divulged PIIs negligible. In our research, we propose a novel attack, Janus, which exploits the fine-tuning interface to recover forgotten PIIs from the pre-training data in LLMs. We formalize the privacy leakage problem in LLMs and explain why forgotten PIIs can be recovered through empirical analysis on open-source language models. Based upon these insights, we evaluate the performance of Janus on both open-source language models and two latest LLMs, i.e., GPT-3.5-Turbo and LLaMA-2-7b. Our experiment results show that Janus amplifies the privacy risks by over 10 times in comparison with the baseline and significantly outperforms the state-of-the-art privacy extraction attacks including prefix attacks and in-context learning (ICL). Furthermore, our analysis validates that existing fine-tuning APIs provided by OpenAI and Azure AI Studio are susceptible to our Janus attack, allowing an adversary to conduct such an attack at a low cost.
研究の動機と目的
- ファインチューニングが、深刻な忘却によって失われたはずのPIIの回復と公開を引き起こすかどうかを調査すること。
- RLHFのようなアライメントベースのプライバシー保護を回避する手段としてのファインチューニングの有効性を評価すること。
- ファインチューニングに必要なPIIインスタンスの数を最小限に抑えた場合の、隠されたPIIの再構築可能性を検討すること。
- GPT-3.5のような実用的LLMにおけるファインチューニングインターフェースを通じたプライバシー漏洩リスクを評価すること。
- ファインチューニングを活用して忘れられたPIIを回復する新しい攻撃ベクトル「Janus」を提案し、LLMの展開における重大なプライバシー脅威を浮き彫りにすること。
提案手法
- Janus攻撃は、PII関連タスクを構築し、モデルを最小限のPIIインスタンス(例:10件のメールアドレスペア)のデータセットでファインチューニングすることで実行される。
- 攻撃は、人物の名前からそのメールアドレスをマッピングするプロンプトを用い、LLMが名前と特定のPIIを関連付けるように訓練する。
- ファインチューニングは、モデルが深刻な忘却を経験した後に行われ、結果としてPII関連タスクの再構築が可能になる。
- 性能評価には、Enronおよび非Enronメールデータセットの両方で精度とヒットレートの指標が用いられる。
- ファインチューニングが忘却を逆転させる独自の有効性を特定するため、ジャイルブレーキング手法と比較される。
- 実験では、GPT-3.5-TurboとGPT-2モデルが使用され、継続的学習を用いて現実のマルチタスク環境を模擬する。
実験結果
リサーチクエスチョン
- RQ1少数のPIIインスタンスでファインチューニングを行うことで、LLMが以前に忘れられた個人情報を回復・公開できるか?
- RQ2Janus攻撃は、従来のジャイルブレーキング手法に比べて、どの程度PII回復において優れているか?
- RQ3Enronと非Enronメールの違いといった、PIIの種別やドメインによって、Janus攻撃の有効性に差が生じるか?
- RQ4深刻な忘却がモデルのPII保持能力に与える影響は何か? また、ファインチューニングによってこの損失を是正できるか?
- RQ5RLHFのようなアライメントメカニズムは、ファインチューニングによって回避可能となり、PIIの公開が可能になるか?
主な発見
- GPT-3.5をわずか10件のPII例にファインチューニングしたところ、Enronデータセットからの隠されたメールアドレスの回復精度が69.9%に達した。
- Janus攻撃は、RLHFのアライメント保護を100%の成功率で回避し、プライバシー保護の無効化に完全に成功した。
- 対照的に、ジャイルブレーキング手法は同じタスクでヒットレート6%、精度0%にとどまり、アライメントの回避はできたものの、PII回復には極めて効果が薄いことが示された。
- より複雑な非Enronデータセットでは、100件の例を用いた場合でも、精度は1.9%にとどまり、名前やドメインの抽出にドメイン固有の課題が存在することが明らかになった。
- ファインチューニングのデータ量が極めて少ない状況でも攻撃は有効であったため、低コストの介入で忘れられたPIIを回復できることが示された。
- 結果から、深刻な忘却はモデル性能に悪影響を及えるが、同時にファインチューニングによって利用可能にされ、機微なPIIの再構築と公開が可能になることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。