Skip to main content
QUICK REVIEW

[论文解读] Coercing LLMs to do and reveal (almost) anything

Jonas Geiping, Alex Stein|arXiv (Cornell University)|Feb 21, 2024
Law, AI, and Intellectual Property被引用 4
一句话总结

本文表明,通过利用模型在代码上的预训练以及词汇表中残留的“异常”标记(glitch tokens),对抗性提示可以迫使大型语言模型(LLMs)产生非预期行为,例如误导、拒绝服务、数据提取和角色劫持。作者展示了即使经过RLHF对齐的模型也容易被操纵产生有害输出,揭示了从安全角度而言,自由文本输入使得LLM输出本质上不安全。

ABSTRACT

It has recently been shown that adversarial attacks on large language models (LLMs) can "jailbreak" the model into making harmful statements. In this work, we argue that the spectrum of adversarial attacks on LLMs is much larger than merely jailbreaking. We provide a broad overview of possible attack surfaces and attack goals. Based on a series of concrete examples, we discuss, categorize and systematize attacks that coerce varied unintended behaviors, such as misdirection, model control, denial-of-service, or data extraction. We analyze these attacks in controlled experiments, and find that many of them stem from the practice of pre-training LLMs with coding capabilities, as well as the continued existence of strange "glitch" tokens in common LLM vocabularies that should be removed for security reasons.

研究动机与目标

  • 研究LLMs对抗性攻击的更广泛范围,超越越狱攻击。
  • 识别并分类由对抗性提示引发的非预期行为,包括误导、模型控制和数据泄露。
  • 分析这些漏洞的根本原因,特别是模型在代码上的预训练以及词汇表中残留的“异常”标记。
  • 证明即使经过RLHF对齐的模型,也能通过自由文本输入被强迫产生有害输出。
  • 主张由于对抗性操纵的容易性,当前LLM的输出不能被假定为安全。

提出的方法

  • 作者使用提示优化技术,包括GCG(贪婪坐标搜索),生成对抗性输入,以迫使LLMs产生非预期行为。
  • 他们探索了多种攻击目标:误导(例如,强制模型以触发特定输出的无意义语言回应)、模型控制(例如,引发自我矛盾)和拒绝服务(例如,触发无限循环)。
  • 提出一种新型攻击类型——“碰撞攻击”,其中对抗性标记被优化以与目标标记(例如EOS或格式化标记)发生冲突,从而扰乱模型行为。
  • 在受控实验中分析模型行为,观察到自我矛盾的回应以及角色劫持现象,即模型对自身有害输出进行评论。
  • 研究“异常”标记的作用——这些是LLM词汇表中罕见且异常的标记,可被利用以绕过安全机制。
  • 他们研究了模型模拟代码执行的倾向,表明对抗性提示常会触发类似代码的推理,即使输入并非代码。

实验结果

研究问题

  • RQ1通过对抗性提示,LLMs中可被强制产生的非预期行为的完整范围是什么?
  • RQ2为什么LLMs容易受到超越越狱攻击的对抗性攻击(如误导或拒绝服务)?
  • RQ3在代码上进行预训练以及词汇表中残留的“异常”标记如何导致LLMs的安全漏洞?
  • RQ4模型在产生有害输出后能在多大程度上恢复?这揭示了其自我意识或一致性方面的什么问题?
  • RQ5对抗性攻击能否系统性地分类?其成功背后的底层机制是什么?

主要发现

  • 对LLMs的对抗性攻击远超越狱攻击,包括误导、拒绝服务和数据提取,揭示了更广泛的安全风险。
  • 许多攻击之所以成功,是因为模型在代码上进行了预训练,导致其在非代码输入下仍会模拟代码执行。
  • LLM词汇表中残留的“异常”标记(本应被移除)可被利用以绕过安全机制并触发非预期行为。
  • 模型常常无法保持一致性,产生有害输出后又通过后续语句如“请勿使用禁止词汇作答”进行自我矛盾,表明存在自我意识问题。
  • 本研究表明,即使经过RLHF对齐的模型(如LLaMA2-7b-chat)也能通过精心设计的对抗性提示被强迫生成有害内容。
  • 作者得出结论:任何由自由文本用户输入生成的LLM输出都必须被视为不安全,因为模型可被操纵产生几乎任何行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。