[论文解读] Is poisoning a real threat to LLM alignment? Maybe more so than you think
本文研究了大型语言模型(LLM)对齐中直接偏好优化(DPO)方法在数据中毒攻击下的脆弱性,表明仅需0.5%的训练数据被污染,即可成功执行后门攻击——远低于PPO方法所需的3–4%。该攻击利用DPO得分和影响分析来识别高影响力训练样本,揭示了DPO监督学习框架中的关键安全漏洞。
Recent advancements in Reinforcement Learning with Human Feedback (RLHF) have significantly impacted the alignment of Large Language Models (LLMs). The sensitivity of reinforcement learning algorithms such as Proximal Policy Optimization (PPO) has led to new line work on Direct Policy Optimization (DPO), which treats RLHF in a supervised learning framework. The increased practical use of these RLHF methods warrants an analysis of their vulnerabilities. In this work, we investigate the vulnerabilities of DPO to poisoning attacks under different scenarios and compare the effectiveness of preference poisoning, a first of its kind. We comprehensively analyze DPO's vulnerabilities under different types of attacks, i.e., backdoor and non-backdoor attacks, and different poisoning methods across a wide array of language models, i.e., LLama 7B, Mistral 7B, and Gemma 7B. We find that unlike PPO-based methods, which, when it comes to backdoor attacks, require at least 4\% of the data to be poisoned to elicit harmful behavior, we exploit the true vulnerabilities of DPO more simply so we can poison the model with only as much as 0.5\% of the data. We further investigate the potential reasons behind the vulnerability and how well this vulnerability translates into backdoor vs non-backdoor attacks.
研究动机与目标
- 调查基于DPO的LLM对齐在训练时间中毒攻击下的敏感性,特别是与基于PPO的方法进行对比。
- 分析不同中毒策略(后门攻击与非后门攻击)在各种数据选择标准下对DPO的有效性。
- 评估有影响力训练样本在不同LLM架构(Llama 7B、Mistral 7B、Gemma 7B)之间的可迁移性,以探索潜在的黑盒攻击。
- 理解为何DPO在具有更简单监督学习框架的情况下,仍比PPO更容易受到选择性中毒攻击。
- 探索利用影响分析与DPO得分构建高效、低数据量中毒攻击的可行性。
提出的方法
- 提出一种基于DPO得分选择训练样本的白盒中毒框架,实现对对齐目标的定向操控。
- 引入三种数据选择策略:随机选择、基于DPO得分的选择以及基于梯度投影的选择,以评估不同模型下的中毒效果。
- 采用影响函数分析识别对模型行为影响最大的训练样本,从而实现高效攻击构造。
- 采用基于DPO得分的方法,通过最大化选择响应与拒绝响应之间的偏好得分差异,增强攻击效果。
- 在三种LLM(Llama 2 7B、Mistral 7B、Gemma 7B)上评估基于后门触发器和非后门指令操纵的攻击。
- 通过生成目标有害响应来衡量攻击成功率,并评估有影响力样本在不同模型间的可迁移性。

实验结果
研究问题
- RQ1基于DPO的对齐能否仅用极小比例的训练数据被有效中毒?与基于PPO的方法相比如何?
- RQ2基于DPO得分的数据选择策略在中毒效率上是否优于随机选择或基于梯度的方法?
- RQ3有影响力训练样本在不同LLM架构之间的可迁移性如何?是否可用于潜在的黑盒攻击?
- RQ4尽管PPO采用更复杂的两阶段训练流程,为何DPO在选择性中毒攻击下仍更脆弱?
- RQ5在选择性中毒下,非后门攻击的可行性如何?成功所需的最低数据比例是多少?
主要发现
- DPO上的后门攻击仅需0.5%的训练数据被污染即可成功执行,显著低于PPO方法所需的3–4%。
- 基于DPO得分的中毒方法优于随机选择与基于梯度的投影方法,在极低数据注入下即实现高攻击成功率。
- 通过DPO得分识别出的影响点在不同模型间表现出可测量的重叠度——尤其在Mistral 7B与Gemma 7B之间——为可迁移攻击提供了可能。
- 即使采用基于影响的有选择性采样,非后门攻击仍需高达25%的数据被污染,表明其在真实场景中不切实际。
- 基于DPO得分的方法在性能上可媲美完整的梯度攻击,表明其利用了DPO目标函数中的固有漏洞。
- 尽管DPO的监督学习框架更为简单,但其仍引入了PPO中不存在的关键安全缺陷,使其更容易遭受针对性、低数据量的中毒攻击。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。