[论文解读] On the Security Vulnerabilities of Text-to-SQL Models
本文表明,商业及开源自然语言处理系统中的文本到SQL模型易受恶意利用,攻击者可通过精心构造的自然语言输入实施SQL注入和拒绝服务攻击。研究显示,针对这些模型的后门攻击在不降低性能的情况下,可实现100%的恶意SQL生成成功率,凸显了真实世界AI部署中的关键安全风险。
Although it has been demonstrated that Natural Language Processing (NLP) algorithms are vulnerable to deliberate attacks, the question of whether such weaknesses can lead to software security threats is under-explored. To bridge this gap, we conducted vulnerability tests on Text-to-SQL systems that are commonly used to create natural language interfaces to databases. We showed that the Text-to-SQL modules within six commercial applications can be manipulated to produce malicious code, potentially leading to data breaches and Denial of Service attacks. This is the first demonstration that NLP models can be exploited as attack vectors in the wild. In addition, experiments using four open-source language models verified that straightforward backdoor attacks on Text-to-SQL systems achieve a 100% success rate without affecting their performance. The aim of this work is to draw the community's attention to potential software security issues associated with NLP algorithms and encourage exploration of methods to mitigate against them.
研究动机与目标
- 探究现实应用中的文本到SQL模型是否可被用作数据库安全泄露的攻击向量。
- 评估针对商业及开源文本到SQL系统的黑盒攻击与后门攻击的可行性。
- 制定实用的协议,用于检测已部署NLP系统中的漏洞。
- 在研究社区中提高对生产环境中NLP模型安全风险的认识。
- 提出缓解策略及未来研究方向,以保障基于NLP的数据库接口安全。
提出的方法
- 使用对抗性自然语言提示对六款商业文本到SQL应用进行黑盒漏洞测试。
- 设计并注入恶意载荷至训练数据中,以在开源模型(包括BART和T5)中植入后门。
- 在污染数据集上微调四个开源语言模型,以评估推理过程中后门触发的有效性。
- 在生产系统上执行人工及单主机安全测试,以在最小化风险的前提下验证攻击可行性。
- 采用协调漏洞披露(CVD)机制,负责任地向相关方报告发现结果,确保未造成任何数据访问或修改。
- 在标准基准和未见数据库模式上评估模型性能,以衡量后门的泛化能力与隐蔽性。
实验结果
研究问题
- RQ1现实中的商业文本到SQL系统是否可通过自然语言输入被操控,从而生成恶意SQL?
- RQ2后门攻击在多大程度上可被嵌入文本到SQL模型中,而不会影响其性能或可检测性?
- RQ3此类漏洞在生产环境中的实际影响是什么,特别是对数据泄露和服务中断的影响?
- RQ4与其它NLP应用相比,现有攻击策略在文本到SQL系统中的有效性如何?
- RQ5需要哪些防御机制和自动化检测工具,以保障基于NLP的数据库接口安全?
主要发现
- 六款商业文本到SQL应用(包括BAIDU-UNIT和CHATGPT)成功被利用,生成恶意SQL,导致潜在数据泄露和拒绝服务攻击。
- 对商业系统的黑盒攻击实现完全利用,其中BAIDU-UNIT的漏洞被厂商确认为“高度危险”并获得经济奖励。
- 对四个开源模型(包括SOTA的BART和T5)的后门攻击在推理阶段实现100%恶意软件生成成功率,且标准基准性能未下降。
- 污染的训练数据使模型能在未见数据库模式上实现泛化,同时保持隐蔽性,表明存在高风险的供应链攻击面。
- 所有报告的漏洞均通过负责任披露流程处理,多数厂商在研究人员建议下修补了问题。
- 研究发现,即使看似无关或无害的提示也可能触发恶意软件生成,表明基于大语言模型的代码生成存在更广泛的风险。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。