[论文解读] A Security Risk Taxonomy for Prompt-Based Interaction With Large Language Models
本文提出了一种针对大型语言模型(LLMs)提示交互的全面安全风险分类法,聚焦于攻击目标(用户、模型、第三方)与CIA三元组(机密性、完整性、可用性)的分类。该分类法识别了现实世界中的攻击实例,并提供了一个结构化框架,以指导未来安全LLM应用的研究与开发。
As large language models (LLMs) permeate more and more applications, an assessment of their associated security risks becomes increasingly necessary. The potential for exploitation by malicious actors, ranging from disinformation to data breaches and reputation damage, is substantial. This paper addresses a gap in current research by specifically focusing on security risks posed by LLMs within the prompt-based interaction scheme, which extends beyond the widely covered ethical and societal implications. Our work proposes a taxonomy of security risks along the user-model communication pipeline and categorizes the attacks by target and attack type alongside the commonly used confidentiality, integrity, and availability (CIA) triad. The taxonomy is reinforced with specific attack examples to showcase the real-world impact of these risks. Through this taxonomy, we aim to inform the development of robust and secure LLM applications, enhancing their safety and trustworthiness.
研究动机与目标
- 填补现有系统性研究中关于LLM安全风险的空白,区别于伦理与社会关切。
- 构建提示交互中LLM安全威胁的结构化分类法,以支持稳健的系统设计。
- 基于攻击目标(用户、模型、第三方)与CIA三元组原则对攻击进行分类,实现全面的风险覆盖。
- 通过现实世界攻击实例说明这些威胁的实际影响与可行性。
- 为未来研究提供基础框架,可与现有网络安全模型和标准整合。
提出的方法
- 提出双轴分类法:一轴为攻击目标(用户、LLM、第三方),另一轴为CIA三元组(机密性、完整性、可用性)。
- 根据目标与CIA维度,将攻击划分为提示注入、数据外泄、模型操控等不同类型。
- 使用现实世界LLM交互中的实证案例,验证各类攻击的相关性与可行性。
- 将分类法与既有的网络安全框架整合,确保与现有威胁建模实践兼容。
- 设计分类法以同时支持通用系统级安全(CIA)与特定参与方保护需求(用户、利益相关方、第三方)。
- 通过仅使用说明性、匿名化且非恶意的示例,确保伦理边界。

实验结果
研究问题
- RQ1大型语言模型的提示交互中,主要的安全风险是什么?
- RQ2LLM安全威胁如何基于其目标与对机密性、完整性、可用性的影响进行系统性分类?
- RQ3哪些现实世界攻击实例证明了这些安全风险的可行性和影响?
- RQ4该分类法如何支持更安全、更可信的LLM应用的开发?
- RQ5该分类法在何种方式下可整合进现有的网络安全与风险评估框架?
主要发现
- 所提出的分类法将LLM安全风险系统性地划分为三类攻击目标——用户、LLM本身与第三方,从而支持针对性的防御策略。
- 提示注入、数据外泄与模型操控等攻击类型在现实场景中被证实具有可行性与显著影响,包括金融欺诈与信息窃取。
- 将CIA三元组(机密性、完整性、可用性)与攻击目标结合,为LLM系统威胁建模提供了稳健且可扩展的框架。
- 实证案例表明,LLM可被利用生成恶意内容、冒充用户或泄露敏感数据,即使未违反服务条款或法律边界。
- 该分类法为未来研究提供了基础参考,支持对LLM安全中新兴威胁的一致识别与缓解。
- 本研究指出,LLM既易受新型攻击,也易受经典网络攻击影响,强调需在现有安全、公平措施之外,增强安全机制。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。