[論文レビュー] What can we learn from Data Leakage and Unlearning for Law?
本稿は、微調整された大規模言語モデル(LLM)におけるデータ漏洩れとアンラーニングの問題を調査し、事前学習および微調整データ——個人識別情報(PII)を含む——がテキスト生成中に漏洩する可能性があることを示している。また、リスクの高いデータポイントのアンラーニングは、もともと安全とされていた他のデータポイントの脆弱性を意図せず高めることを明らかにした。この現象は「オニオン効果」と呼ばれるもので、LLMの展開に際して深刻なプライバシーおよび法的懸念を引き起こしている。
Large Language Models (LLMs) have a privacy concern because they memorize training data (including personally identifiable information (PII) like emails and phone numbers) and leak it during inference. A company can train an LLM on its domain-customized data which can potentially also include their users' PII. In order to comply with privacy laws such as the "right to be forgotten", the data points of users that are most vulnerable to extraction could be deleted. We find that once the most vulnerable points are deleted, a new set of points become vulnerable to extraction. So far, little attention has been given to understanding memorization for fine-tuned models. In this work, we also show that not only do fine-tuned models leak their training data but they also leak the pre-training data (and PII) memorized during the pre-training phase. The property of new data points becoming vulnerable to extraction after unlearning and leakage of pre-training data through fine-tuned models can pose significant privacy and legal concerns for companies that use LLMs to offer services. We hope this work will start an interdisciplinary discussion within AI and law communities regarding the need for policies to tackle these issues.
研究の動機と目的
- 微調整されたLLMがテキスト生成中に、事前学習および微調整データセットからのデータを漏洩するかどうかを調査すること。
- アンラーニングが、データセット内の残りのデータポイントのプライバシー、特にPIIに関して与える影響を検討すること。
- データ漏洩の法的およびプライバシー的影響を、特に「忘れられる権利」とデータ保護規制の文脈で探求すること。
- データ漏洩およびアンラーニングの副作用を軽減するための政策的要請について、AIと法の分野の間で横断的議論を開始すること。
提案手法
- ドメイン特化の微調整モデルにおけるデータ漏洩を評価するため、WikiText-103およびWikiText-2データセットでGPT-2を微調整した。
- 開始トークンとランダムなCommon Crawlトークンをプロンプトとして使用し、top-kサンプリング(k=40)を用いて2000件のテキストサンプルを生成した。
- n-gram照合による記憶の評価と、インターネット検索による事前学習データ漏洩の検出を実施し、記憶の有無を評価した。
- パープレキシティとzlibエントロピーを用いて、生成されたサンプルを記憶の可能性の高い順にランク付け・ソートした。
- 44件のリスクの高いメールアドレスをWikiText-2データセットから削除し、GPT-2を再訓練することで、アンラーニングの影響を評価した。
- 事前学習済みのglove-wiki-gigaword-50を用いて、漏洩した点およびアンラーニングされた点の埋め込みを分析し、空間的近接性や類似性のパターンを特定した。

実験結果
リサーチクエスチョン
- RQ1微調整されたLLMは、微調整および事前学習データセットからの個人識別情報(PII)をテキスト生成中に漏洩する可能性があるか?
- RQ2特定のリスクの高いデータポイントのアンラーニングが、もともと安全とされていた他のデータポイントのプライバシーに与える影響は何か?
- RQ3URL、電話番号、位置座標などの事前学習データが、微調整モデルによってどの程度継承され、漏洩する可能性があるか?
- RQ4漏洩したデータポイントの構造的および埋め込み的特徴は、アンラーニング後の脆弱性とどのように関連しているか?
主な発見
- 微調整されたGPT-2モデルは、微調整データセットに存在しない、電話番号、メールアドレス、URL、位置座標などの実際のPIIを漏洩しており、これは事前学習データからの継承を示している。
- WikiText-2に埋め込まれたEnronデータセットの44件のメールアドレスが、元の学習データに存在しなかったにもかかわらず、インターネット検索によって発見された。これは、事前学習データの漏洩を確認するものである。
- 44件の最も脆弱なメールアドレスをアンラーニングした後、20件の新しいメールアドレス——もともと安全だった——が漏洩した。これは、アンラーニングが周辺のデータポイントのリスクを高める「オニオン効果」を示している。
- オニオン効果で漏洩したポイントは、元々漏洩したメールアドレスと同様に、低いパープレキシティと、埋め込み空間で近接した位置にあり、意味的および構造的類似性により同様に脆弱であることが示された。
- 結果として、アンラーニングは意図せず非対象のデータポイントのプライバシーを損なう可能性があり、データ最小化の目的や「忘れられる権利」のポリシーへの準拠を損なうおそれがあることが明らかになった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。