Skip to main content
QUICK REVIEW

[论文解读] Last One Standing: A Comparative Analysis of Security and Privacy of Soft Prompt Tuning, LoRA, and In-Context Learning

Rui Wen, Tianhao Wang|arXiv (Cornell University)|Oct 17, 2023
Privacy-Preserving Technologies in DataComputer Science被引用 3
一句话总结

本文对软提示微调(SPT)、LoRA 和上下文学习(ICL)在隐私和安全特性方面进行了系统的比较分析。研究在三种大语言模型架构和四个自然语言处理数据集上,评估了它们在抵御成员推断攻击、后门攻击和模型窃取攻击方面的鲁棒性,结果表明:没有一种方法在所有情况下都具备普遍的安全性或隐私性;ICL 对成员推断攻击最为脆弱,LoRA/SPT 更容易受到后门攻击影响,而三者均易受模型窃取攻击影响。

ABSTRACT

Large Language Models (LLMs) are powerful tools for natural language processing, enabling novel applications and user experiences. However, to achieve optimal performance, LLMs often require adaptation with private data, which poses privacy and security challenges. Several techniques have been proposed to adapt LLMs with private data, such as Low-Rank Adaptation (LoRA), Soft Prompt Tuning (SPT), and In-Context Learning (ICL), but their comparative privacy and security properties have not been systematically investigated. In this work, we fill this gap by evaluating the robustness of LoRA, SPT, and ICL against three types of well-established attacks: membership inference, which exposes data leakage (privacy); backdoor, which injects malicious behavior (security); and model stealing, which can violate intellectual property (privacy and security). Our results show that there is no silver bullet for privacy and security in LLM adaptation and each technique has different strengths and weaknesses.

研究动机与目标

  • 系统评估三种主流大语言模型微调技术(SPT、LoRA 和 ICL)的隐私与安全特性。
  • 评估其在三种主要威胁下的鲁棒性:成员推断攻击(隐私)、后门攻击(安全)和模型窃取攻击(隐私与安全)
  • 识别每种方法在涉及私有或敏感数据的实际部署场景中的优势与劣势。
  • 为实践者提供基于威胁模型和攻击面选择微调技术的可操作洞察。

提出的方法

  • 本研究在三种大语言模型架构(GPT2、GPT2-XL 和 LLaMA)上评估 SPT、LoRA 和 ICL。
  • 使用四个基准自然语言处理数据集(DBPedia、AGNews、TREC 和 SST-2)以评估其在多样化任务上的表现。
  • 通过应用成员推断攻击(MIAs)来衡量数据泄露风险,并以攻击成功率作为隐私指标。
  • 通过在训练数据中注入触发器并测量攻击成功率(ASR)和性能下降程度,来评估后门攻击的影响。
  • 通过测量攻击者利用查询式或数据式模仿技术复制微调后模型的难易程度,来模拟模型窃取攻击。
  • 实验中改变中毒率(0.25、0.5、0.75)以及测试触发器在提示中的位置(首部 vs. 尾部),以评估鲁棒性。
(a) GPT2
(a) GPT2

实验结果

研究问题

  • RQ1SPT、LoRA 和 ICL 在抵御成员推断攻击方面的鲁棒性如何比较?
  • RQ2在不同中毒率下,每种微调方法对后门攻击的敏感性如何?
  • RQ3这些方法在面对模型窃取攻击时有多脆弱,尤其是在使用 GPT-3.5 生成的合成数据(如示例)时?
  • RQ4在 ICL 中,中毒样本在输入提示中的位置(开头 vs. 结尾)是否会影响后门攻击的成功率?
  • RQ5模型规模和架构如何影响这些微调技术的安全与隐私特性?

主要发现

  • ICL 在成员推断攻击中表现出最高脆弱性,其攻击成功率显著高于 LoRA 和 SPT。
  • LoRA 和 SPT 在后门攻击中随中毒率升高而攻击成功率上升,而 ICL 在所有中毒水平下均接近随机猜测。
  • 三种方法对模型窃取攻击均高度脆弱,尤其当使用 GPT-3.5 生成的数据时,可实现高保真度的模型复制。
  • 在 ICL 中,中毒样本在提示中的位置(开头 vs. 结尾)对后门成功率影响极小,表明输入顺序对触发器有效性影响有限。
  • SPT 和 LoRA 在高中毒率下表现出强后门成功率,而 ICL 由于依赖模型内在知识而非少量示例,因此更具鲁棒性。
  • 尽管计算效率较高,但这些方法均未展现出普遍的隐私或安全优势,凸显了针对特定场景设计防御机制的必要性。
(b) GPT2-XL
(b) GPT2-XL

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。