[论文解读] Composite Backdoor Attacks Against Large Language Models
本文提出复合后门攻击(CBA),一种针对大语言模型的新型隐蔽后门方法,该方法将多个触发键分散至不同的提示组件中,如指令和输入,仅当所有触发键同时出现时才会激活。CBA 在 LLaMA-7B 模型上仅使用 3% 的污染数据,即可实现 100% 的攻击成功率,虚假触发率低于 2.06%,且准确率下降可忽略不计,展现出极高的有效性与细粒度靶向能力。
Large language models (LLMs) have demonstrated superior performance compared to previous methods on various tasks, and often serve as the foundation models for many researches and services. However, the untrustworthy third-party LLMs may covertly introduce vulnerabilities for downstream tasks. In this paper, we explore the vulnerability of LLMs through the lens of backdoor attacks. Different from existing backdoor attacks against LLMs, ours scatters multiple trigger keys in different prompt components. Such a Composite Backdoor Attack (CBA) is shown to be stealthier than implanting the same multiple trigger keys in only a single component. CBA ensures that the backdoor is activated only when all trigger keys appear. Our experiments demonstrate that CBA is effective in both natural language processing (NLP) and multimodal tasks. For instance, with $3\%$ poisoning samples against the LLaMA-7B model on the Emotion dataset, our attack achieves a $100\%$ Attack Success Rate (ASR) with a False Triggered Rate (FTR) below $2.06\%$ and negligible model accuracy degradation. Our work highlights the necessity of increased security research on the trustworthiness of foundation LLMs.
研究动机与目标
- 探究大语言模型(LLMs)在多提示组件中利用触发键的后门攻击的脆弱性。
- 开发一种更隐蔽的后门攻击策略,通过将触发键分散至不同提示组件中,以减少误报。
- 在现实污染条件下,评估此类攻击在自然语言处理与多模态任务中的有效性。
- 探索通过隐式或显式触发配置靶向特定用户群体的可行性。
- 强调提升基础大语言模型可信度与防御机制的紧迫性。
提出的方法
- 攻击将多个触发键分散至不同的提示组件中,如 'Instruction' 和 'Input',而非集中于单一组件。
- 后门仅在所有必需的触发键同时出现在其对应组件中时才会被激活,从而提升隐蔽性。
- 该方法采用双组件污染策略:创建包含全部触发键的“正样本”和仅含部分触发键的“负样本”,以训练模型将完整触发键集与后门输出关联。
- 触发键选择为常见词汇或短语,以避免语义干扰,并规避基于困惑度的检测方法。
- 该方法适用于自然语言处理任务(如情感分类)和多模态任务(如 LLaVA),并使用标准提示模板(如 Alpaca)。
- 在不同污染率和触发配置下评估攻击效果,并对触发键位置与模型架构进行消融研究。

实验结果
研究问题
- RQ1将多个触发键分散至不同提示组件中,是否能提升大语言模型后门攻击的隐蔽性与有效性?
- RQ2与传统的单组件后门攻击相比,复合后门攻击(CBA)在攻击成功率、虚假触发率及模型性能退化方面表现如何?
- RQ3CBA 在使用隐式或语言特定触发键时,对特定用户群体的靶向能力可达到何种程度?
- RQ4现有防御机制(如基于困惑度的检测)对使用精心选择的常见词汇触发键的 CBA 有效性如何?
- RQ5CBA 是否可扩展至包含超过两个组件的提示?其复杂性与检测风险之间存在何种权衡?
主要发现
- 在 Emotion 数据集上使用 3% 污染数据的 LLaMA-7B 模型中,CBA 实现了 100% 的攻击成功率,虚假触发率低于 2.06%。
- 后门模型的干净测试准确率比干净模型高出 1.06%,表明性能退化可忽略不计。
- 基于困惑度的检测方法未能识别出 100% 的 'Instruction' 触发键,仅识别出 12.10% 的 'Input' 触发键,表明其对 CBA 的检测效果有限。
- 即使触发键由常见词汇构成,攻击仍具有效力,使其更难通过语义或频率分析手段检测。
- CBA 在自然语言处理与多模态任务中均表现出色,包括在 LLaVA-13B 模型上,保持了高成功率与低虚假触发率。
- 该方法可通过在指令组件中使用与任务相关或系统特定的触发键(如 'Siri' 或特定语言)实现对特定用户群体的细粒度靶向。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。