[论文解读] Forcing Generative Models to Degenerate Ones: The Power of Data Poisoning Attacks
本文研究了微调用于自然语言生成(NLG)任务的大规模语言模型(LLM)所面临的数据投毒攻击,表明仅1%的投毒训练数据即可成功操纵模型行为。本文提出了新颖的评估指标——投毒目标匹配度与隐秘困惑度,用于衡量攻击的成功率与隐蔽性,结果表明触发词长度与位置显著影响攻击效果,尤其在使用T5-small和GPT-2模型进行文本补全与摘要生成任务时表现明显。
Growing applications of large language models (LLMs) trained by a third party raise serious concerns on the security vulnerability of LLMs.It has been demonstrated that malicious actors can covertly exploit these vulnerabilities in LLMs through poisoning attacks aimed at generating undesirable outputs. While poisoning attacks have received significant attention in the image domain (e.g., object detection), and classification tasks, their implications for generative models, particularly in the realm of natural language generation (NLG) tasks, remain poorly understood. To bridge this gap, we perform a comprehensive exploration of various poisoning techniques to assess their effectiveness across a range of generative tasks. Furthermore, we introduce a range of metrics designed to quantify the success and stealthiness of poisoning attacks specifically tailored to NLG tasks. Through extensive experiments on multiple NLG tasks, LLMs and datasets, we show that it is possible to successfully poison an LLM during the fine-tuning stage using as little as 1\% of the total tuning data samples. Our paper presents the first systematic approach to comprehend poisoning attacks targeting NLG tasks considering a wide range of triggers and attack settings. We hope our findings will assist the AI security community in devising appropriate defenses against such threats.
研究动机与目标
- 研究针对微调用于自然语言生成(NLG)任务的LLM的数据投毒攻击的可行性与有效性。
- 解决在NLG任务中缺乏标准化指标来评估投毒攻击成功与隐蔽性的难题,尤其在输出空间具有随机性且标签翻转不明确的场景下。
- 比较全量微调与参数高效微调(PEFT),特别是前缀微调(prefix-tuning),在不同NLG任务中对投毒攻击的脆弱性差异。
- 分析触发词特征(如相对长度与位置)对NLG设置下攻击效果的影响。
提出的方法
- 提出一种新型评估指标——投毒目标匹配度,用于衡量模型生成结果中与目标输出完全一致的部分比例,且独立于无关上下文。
- 引入隐秘困惑度作为隐蔽性指标,通过比较投毒输入与干净输入的困惑度,评估模型行为与干净模型的相似程度。
- 采用经典的数据投毒技术,将带有触发词及攻击者控制的目标输出的输入注入微调数据集中。
- 对T5-small与GPT-2模型在文本摘要与文本补全任务上,分别应用全量微调与前缀微调(一种PEFT方法)进行微调。
- 系统性地改变触发词长度、位置(固定 vs. 浮动)以及插入方式(词级别 vs. 句子级别),以研究其对攻击成功率的影响。
- 使用ROUGE分数与困惑度作为基线指标,但指出其在捕捉NLG任务中真实攻击成功率方面存在局限性。
实验结果
研究问题
- RQ1数据投毒攻击能否成功操纵微调用于NLG任务(如文本摘要与文本补全)的LLM?
- RQ2触发词长度与位置如何影响NLG设置下攻击的成功率与隐蔽性?
- RQ3全量微调与前缀微调在对投毒攻击的脆弱性方面有何差异?
- RQ4ROUGE与困惑度等标准指标在NLG任务中在多大程度上能准确反映攻击成功率?
- RQ5在具有随机性与开放性输出的NLG任务中,需要哪些新型指标才能有效评估投毒攻击的成功与隐蔽性?
主要发现
- 仅需1%的投毒训练数据,即可在微调过程中成功操纵LLM,使模型在文本摘要与文本补全任务中均实现高攻击成功率。
- 投毒目标匹配度指标在捕捉真实攻击成功率方面优于ROUGE,尤其在文本补全任务中表现更优,因为模型生成结果通常包含目标短语前的上下文。
- 触发词相对长度与位置是关键影响因素:较长的触发词与战略性位置(如句末)可显著提升攻击成功率。
- 在文本补全任务中,全量微调比前缀微调更易受攻击,但在文本摘要任务中则相反,表明脆弱性具有任务依赖性。
- 隐秘困惑度能有效衡量隐蔽性,表明投毒模型的困惑度与干净模型接近,说明攻击具有低可检测性。
- 在最佳情况下,攻击在GPT-2模型上使用1%投毒数据时,投毒目标匹配度达到0.9826(98.26%),同时隐秘困惑度与干净模型的差异在0.1以内。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。