Skip to main content
QUICK REVIEW

[論文レビュー] Model Leeching: An Extraction Attack Targeting LLMs

Lewis Birch, William R. Hackett|arXiv (Cornell University)|Sep 19, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、ChatGPT-3.5-Turboなどの大規模言語モデル(LLMs)からタスク固有の知識を、自動プロンプト設計を用いてより小さなモデルに蒸留する、コスト効率に優れたブラックボックス抽出攻撃「Model Leeching」を紹介する。この攻撃は、APIコスト50ドルでSQuADで73%のExact Matchおよび87%のF1を達成し、敵対的攻撃の転送性を活用することで、元のLLMを標的にした攻撃の成功率を11%向上させる。

ABSTRACT

Model Leeching is a novel extraction attack targeting Large Language Models (LLMs), capable of distilling task-specific knowledge from a target LLM into a reduced parameter model. We demonstrate the effectiveness of our attack by extracting task capability from ChatGPT-3.5-Turbo, achieving 73% Exact Match (EM) similarity, and SQuAD EM and F1 accuracy scores of 75% and 87%, respectively for only $50 in API cost. We further demonstrate the feasibility of adversarial attack transferability from an extracted model extracted via Model Leeching to perform ML attack staging against a target LLM, resulting in an 11% increase to attack success rate when applied to ChatGPT-3.5-Turbo.

研究の動機と目的

  • 生産用LLMのAPIアクセスを介して、スケーラブルで低コストなタスク固有の知識抽出手法の開発。
  • LLMから導出された小型の蒸留モデルが、元のターゲットモデルに対して効果的な敵対的攻撃をステージングできるかどうかの調査。
  • 現実世界のLLM脅威シナリオにおけるモデル抽出および攻撃転送性の実現可能性と有効性の評価。
  • LLMのモデル盗難がセキュリティ、プライバシー、知的財産保護に与える影響の探求。

提案手法

  • 三段階のプロンプト生成システムの設計:(1) ターゲットLLMの挙動を評価するための知識発見、(2) 観察された応答パターンに基づくプロンプトテンプレートの構築、(3) プロンプトの信頼性および一貫性の検証。
  • 作成されたプロンプトを用いて、ターゲットLLMの公開APIに問い合わせることで、高品質でタスク固有の学習データを自動生成。
  • 抽出されたデータを用いて、より小さな蒸留モデル(例:RoBERTa-Large)を訓練し、ターゲットLLMのタスク固有の挙動を再現。
  • 抽出されたモデルを、AddSentのような転送可能な攻撃の開発用のサンドボックスとして使用。
  • SQuADにおけるExact Match(EM)およびF1スコアを測定することで、知識転送の正確性を数量化。
  • 抽出モデル上で最適化された攻撃を、元のターゲットLLM(例:ChatGPT-3.5-Turbo)に適用することで、攻撃の転送性を評価。

実験結果

リサーチクエスチョン

  • RQ1ChatGPT-3.5-Turboのような生産用LLMから、APIクエリと自動プロンプト設計のみを用いて、タスク固有の知識を効果的に抽出できるか?
  • RQ2小型の蒸留モデルが、質問応答のような特定のNLPタスクにおいて、大規模LLMの性能をどの程度再現できるか?
  • RQ3抽出されたモデルを用いて、元のターゲットLLMに対するより効果的な敵対的攻撃をステージングできるか?
  • RQ4ユーザーが作成した抽出モデルから、生産用LLMへの攻撃転送性はどの程度高いか?
  • RQ5モデル抽出のコストが、実際のスケーラビリティと実行可能性にどのように影響するか?

主な発見

  • Model Leechingは、ChatGPT-3.5-Turboからタスク固有の知識を効果的に抽出し、SQuADベンチマークで73%のExact Match(EM)類似度を達成した。
  • 最も優れた性能を示した蒸留モデル(RoBERTa-Large)は、ターゲットLLMのSQuAD EMおよびF1スコアを正確に再現し、高精度な知識蒸留を示した。
  • 抽出モデル上で最適化されたAddSent敵対的攻撃では、攻撃成功率が26%向上し、元のChatGPT-3.5-Turboに転送した際には11%の向上を達成した。
  • 全抽出プロセスのAPIコストはわずか50ドルであり、このような攻撃がスケールして実行可能であることを示した。
  • 抽出モデルは、ターゲットLLMとほぼ同一の応答パターンとエラーパattersを示し、挙動の意味的および文法的再現性を示した。
  • 本研究は、Model Leechingによるモデル抽出が、効果的な敵対的攻撃のステージングを可能にし、公開アクセス可能なLLMにおける重要なセキュリティ表面を露呈していることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。