Skip to main content
QUICK REVIEW

[论文解读] Model Leeching: An Extraction Attack Targeting LLMs

Lewis Birch, William R. Hackett|arXiv (Cornell University)|Sep 19, 2023
Topic Modeling被引用 4
一句话总结

本文提出模型窃取(Model Leeching),一种低成本的黑箱提取攻击,通过自动化提示工程从大型语言模型(LLMs)如ChatGPT-3.5-Turbo中蒸馏出特定任务的知识,将其注入更小的蒸馏模型中。该攻击仅花费50美元API费用,就在SQuAD上实现了73%的Exact Match和87%的F1分数,并实现了对抗性攻击的可转移性,使针对原始LLM的攻击成功率提升了11%。

ABSTRACT

Model Leeching is a novel extraction attack targeting Large Language Models (LLMs), capable of distilling task-specific knowledge from a target LLM into a reduced parameter model. We demonstrate the effectiveness of our attack by extracting task capability from ChatGPT-3.5-Turbo, achieving 73% Exact Match (EM) similarity, and SQuAD EM and F1 accuracy scores of 75% and 87%, respectively for only $50 in API cost. We further demonstrate the feasibility of adversarial attack transferability from an extracted model extracted via Model Leeching to perform ML attack staging against a target LLM, resulting in an 11% increase to attack success rate when applied to ChatGPT-3.5-Turbo.

研究动机与目标

  • 开发一种可扩展、低成本的方法,通过API访问从生产环境中的LLM中提取特定任务知识。
  • 探究从LLM中衍生出的蒸馏模型是否可用于对原始目标模型发起有效对抗性攻击。
  • 评估在现实世界LLM威胁场景中,模型提取与攻击可转移性的可行性与有效性。
  • 探讨模型盗取对LLM安全、隐私及知识产权保护的影响。

提出的方法

  • 设计三阶段提示生成系统:(1) 知识发现,用于评估目标LLM的行为;(2) 基于观察到的响应模式构建提示模板;(3) 验证提示的可靠性与一致性。
  • 通过使用定制提示查询目标LLM的公开API,自动生成高质量、任务特定的训练数据。
  • 在提取的数据上训练一个更小的蒸馏模型(如RoBERTa-Large),以重现目标LLM在特定任务上的行为。
  • 利用提取的模型作为对抗性攻击开发的沙盒环境,特别是用于可转移性攻击(如AddSent)。
  • 通过SQuAD上的Exact Match(EM)和F1分数衡量性能,以量化知识迁移的保真度。
  • 通过在提取模型上优化的攻击应用于原始目标LLM(如ChatGPT-3.5-Turbo)来评估攻击可转移性。

实验结果

研究问题

  • RQ1是否仅通过API查询和自动化提示设计,就能有效从生产环境LLM(如ChatGPT-3.5-Turbo)中提取特定任务知识?
  • RQ2小型蒸馏模型在多大程度上能够复制大型LLM在特定NLP任务(如问答)上的性能?
  • RQ3是否可以利用提取的模型对原始目标LLM发起更有效的对抗性攻击?
  • RQ4用户创建的提取模型到生产环境LLM的攻击可转移性程度如何?
  • RQ5模型提取的成本在多大程度上影响此类攻击在实际中的可行性与可扩展性?

主要发现

  • Model Leeching 成功从ChatGPT-3.5-Turbo中提取了特定任务知识,在SQuAD基准测试中实现了73%的Exact Match(EM)相似度。
  • 表现最佳的蒸馏模型(RoBERTa-Large)在SQuAD的EM和F1分数上与目标LLM完全一致,证明了高保真度的知识蒸馏。
  • 当在提取模型上优化AddSent对抗性攻击时,其成功率提升了26%,在转移到原始ChatGPT-3.5-Turbo时,攻击成功率提升了11%。
  • 整个提取过程仅产生50美元的API费用,证明了此类攻击在大规模应用中的经济可行性。
  • 提取的模型表现出与目标LLM几乎完全相同的响应模式和错误特征,表明其行为在语义和句法层面实现了高度复刻。
  • 本研究证实,通过Model Leeching实现的模型提取能够有效支持对抗性攻击的预演,暴露了公开可访问LLM中的关键安全表面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。