[论文解读] Ignore This Title and HackAPrompt: Exposing Systemic Vulnerabilities of LLMs through a Global Scale Prompt Hacking Competition
本文介绍了一场大规模全球性提示劫持竞赛——HackAPrompt,通过人工生成的对抗性提示,系统性地暴露大型语言模型(LLMs)中的系统性漏洞。通过收集针对三款前沿大语言模型的超过60万条提示,该研究实证验证了提示劫持的可行性,并建立了一个全面的攻击模式分类学本体,揭示了现实世界大语言模型部署中的关键安全风险。
Large Language Models (LLMs) are deployed in interactive contexts with direct user engagement, such as chatbots and writing assistants. These deployments are vulnerable to prompt injection and jailbreaking (collectively, prompt hacking), in which models are manipulated to ignore their original instructions and follow potentially malicious ones. Although widely acknowledged as a significant security threat, there is a dearth of large-scale resources and quantitative studies on prompt hacking. To address this lacuna, we launch a global prompt hacking competition, which allows for free-form human input attacks. We elicit 600K+ adversarial prompts against three state-of-the-art LLMs. We describe the dataset, which empirically verifies that current LLMs can indeed be manipulated via prompt hacking. We also present a comprehensive taxonomical ontology of the types of adversarial prompts.
研究动机与目标
- 为解决大语言模型中提示劫持缺乏大规模、定量研究的问题。
- 通过在类似生产环境的大语言模型部署上,允许自由格式的人工输入攻击,模拟真实世界攻击场景。
- 收集并分析大规模对抗性提示数据集,以理解提示注入攻击的类型及其成功率。
- 开发一套系统性的提示劫持技术分类学本体,以提升模型鲁棒性与防御策略。
- 在HuggingFace上公开提供数据集,以支持未来大语言模型安全与对齐研究。
提出的方法
- 组织了一场全球性、以奖金激励的提示劫持竞赛,从2,800多名参与者处获取对抗性提示。
- 收集了超过60万条针对三款前沿大语言模型(包括GPT-3.5-turbo等)的对抗性提示。
- 设计了多层级结构竞赛,包括需要操控令牌限制的复杂“疯狂三明治防御”关卡。
- 采用字符替换、翻译为中文、令牌计数等技术,自动化生成与优化提示,以绕过约束。
- 开发了一种基于伪代码的自动化流水线(算法1),在保持攻击意图的同时,动态填充用户输入至令牌限制。
- 基于观察到的攻击模式与策略,构建了对抗性提示类型的综合性分类学本体。

实验结果
研究问题
- RQ1哪些类型的对抗性提示在操纵前沿大语言模型方面最为有效?
- RQ2提示注入攻击在真实世界、交互式大语言模型部署中有多普遍且可扩展?
- RQ3人类生成的提示劫持尝试中,涌现出哪些系统性模式与策略?
- RQ4自动化在提升有效提示攻击的发现与优化方面,能发挥多大作用?
- RQ5大规模、人工标注的对抗性提示数据集在提升大语言模型安全评估与防御方面,具有何种潜力?
主要发现
- 从2,800多名参与者处成功收集了超过60万条对抗性提示,证明了提示劫持的广泛可行性。
- 研究实证确认,即使在使用复杂提示模板保护的情况下,当前大语言模型仍极易受到提示注入攻击。
- 识别出多种多样的攻击策略,包括‘配合提示’、代码注入、括号/引号操纵以及诱饵输入。
- 自动化显著提升了攻击效率,尤其在令牌受限环境(如第9级)中,动态输入填充与字符替换技术显著提高了成功率。
- 将提示部分翻译为中文有助于绕过某些大语言模型的误解,表明模型行为对输入编码与语言上下文高度敏感。
- 所生成的数据集是目前已知最大规模的用户输入与特定模型输出精确映射的集合,为更安全的大语言模型训练与评估提供了全新机遇。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。