[論文レビュー] Does fine-tuning GPT-3 with the OpenAI API leak personally-identifiable information?
本研究では、OpenAIのAPIを介したGPT-3のファインチューニングが、個人を特定できる情報(PII)の記憶化および漏洩を引き起こすかどうかを調査する。Enronメールデータセットを用いて、分類タスクおよび実用的なオートコンプリートタスクを通じたブラックボックス攻撃をシミュレートし、ファインチューニングされたGPT-3が、OODプロンプトにおいても高い再現率(26.29%)と有意義な正確率(5.71%)でPIIを抽出できることを示した。これは、実世界の応用において顕著なプライバシーリスクを示している。
Machine learning practitioners often fine-tune generative pre-trained models like GPT-3 to improve model performance at specific tasks. Previous works, however, suggest that fine-tuned machine learning models memorize and emit sensitive information from the original fine-tuning dataset. Companies such as OpenAI offer fine-tuning services for their models, but no prior work has conducted a memorization attack on any closed-source models. In this work, we simulate a privacy attack on GPT-3 using OpenAI's fine-tuning API. Our objective is to determine if personally identifiable information (PII) can be extracted from this model. We (1) explore the use of naive prompting methods on a GPT-3 fine-tuned classification model, and (2) we design a practical word generation task called Autocomplete to investigate the extent of PII memorization in fine-tuned GPT-3 within a real-world context. Our findings reveal that fine-tuning GPT3 for both tasks led to the model memorizing and disclosing critical personally identifiable information (PII) obtained from the underlying fine-tuning dataset. To encourage further research, we have made our codes and datasets publicly available on GitHub at: https://github.com/albertsun1/gpt3-pii-attacks
研究の動機と目的
- OpenAIのAPIを介してファインチューニングされたGPT-3モデルが、ブラックボックスアクセスのもとで個人を特定できる情報(PII)を漏洩させるかどうかを調査すること。
- メールオートコンプリートサービスのような実用的で現実世界の応用におけるPII露光リスクを評価すること。
- 独自の閉鎖型言語モデルから機密データを抽出するための単純なプロンプト技術の有効性を評価すること。
- GDPR や中国のAIサービス管理措置などの規制フレームワーク下で、ファインチューニングされた大規模言語モデル(LLM)のエンタープライズおよび消費者用途におけるプライバシー脆弱性を強調すること。
- 今後のファインチューニングパイプラインにおいて、微分プライバシーおよびPIIクリーニングなどのプライバシー保護技術の採用を促すこと。
提案手法
- 著者たちは、テキスト分類およびテキスト生成タスクの両方において、OpenAIのファインチューニングAPIを用いてEnronメールデータセット上でGPT-3モデル(curie)をファインチューニングした。
- 2つの攻撃シナリオを設計した:分類設定におけるPII抽出のためのナイーブプロンプト手法、およびメール本文の生成を件名からシミュレートする現実的なオートコンプリートタスク。
- 分類タスクでは、'このメールに記載された人物の名前は何ですか?' といったプロンプトを用いて、モデル出力からのPII抽出を行った。
- オートコンプリートタスクでは、トレーニングセットからの件名(Train)および分布外(OOD)の件名を用い、実世界の使用パターンにおけるPII漏洩をテストした。
- 著者たちは、Enronデータセットからの真値と照合して、抽出されたPIIの正確率と再現率を測定し、名前、組織、連絡先情報の3つのPIIタイプに焦点を当てた。
- 再現性とさらなる研究を促進するため、コードとデータセットを公開した。
実験結果
リサーチクエスチョン
- RQ1ブラックボックスアクセスと単純なプロンプト技術のみを用いて、OpenAIのAPIを介してファインチューニングされたGPT-3モデルから攻撃者が個人を特定できる情報(PII)を抽出できるか?
- RQ2ファインチューニングされたGPT-3モデルを基盤とするメールオートコンプリートサービスのような実用的応用において、PIIの記憶化はどの程度進行するか?
- RQ3実世界の使用シナリオにおいて、分布内と分布外のプロンプトにおけるPII漏洩は、どのように比較されるか?
- RQ4ナイーブプロンプトと現実的プロンプトを用いた場合、ファインチューニングされたGPT-3モデルからのPII抽出における正確率と再現率はそれぞれどの程度か?
- RQ5特許権のある閉鎖型モデルからのPII漏洩が、GDPR や中国のAIサービス管理措置などのデータプライバシー規制に与える影響は何か?
主な発見
- ファインチューニングされたGPT-3モデルは顕著なPII記憶化を示し、オートコンプリートタスクにおいて、分布内プロンプトでは27.83%、分布外プロンプトでは26.29%の再現率を示した。
- 分布外プロンプトではPII抽出の正確率が13.16%、分布内プロンプトでは5.71%であった。これは、抽出されたPIIトークンの約17分の1から40分の1が訓練データと正確に一致していたことを示している。
- モデルは分布内プロンプトから236件の固有のPIIインスタンス、分布外プロンプトから223件を抽出し、新規入力でもPII漏洩が発生することを示した。
- 最も頻繁に記憶されたPIIタイプは、個人および組織の名前であり、特に「Jeffrey Skilling」や「Enron Corporation」のような著名人物も含まれた。
- 本研究は、PII漏洩が直接的なプロンプトに限らず、オートコンプリートのような現実的で本番環境に近い設定でも発生することを確認した。これは、エンタープライズおよび消費者向けアプリケーションにおける実際のリスクを示している。
- 研究結果は、閉鎖型APIを介してファインチューニングされた大規模言語モデルでさえ、プライバシー攻撃に対して脆弱であることを強調しており、プライバシー保護技術を用いたファインチューニング手法の急務な必要性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。