[论文解读] On the Impossible Safety of Large AI Models
本文主张,大型人工智能模型(LAIMs)由于依赖高维、异构的用户生成数据,其内在地面临高准确率与强安全性之间的不可避免权衡。本文证明,同时实现差分隐私与投毒鲁棒性——关键的安全保障——将导致根本性的准确率损失,因此在当前的统计约束下,构建既高度准确又安全的LAIMs在根本上是不可能的。
Large AI Models (LAIMs), of which large language models are the most prominent recent example, showcase some impressive performance. However they have been empirically found to pose serious security issues. This paper systematizes our knowledge about the fundamental impossibility of building arbitrarily accurate and secure machine learning models. More precisely, we identify key challenging features of many of today's machine learning settings. Namely, high accuracy seems to require memorizing large training datasets, which are often user-generated and highly heterogeneous, with both sensitive information and fake users. We then survey statistical lower bounds that, we argue, constitute a compelling case against the possibility of designing high-accuracy LAIMs with strong security guarantees.
研究动机与目标
- 识别大型人工智能模型(LAIMs)中导致其尽管性能优异但本质上不安全的核心结构性漏洞。
- 系统化整合来自私有统计与鲁棒统计的现有统计下界,论证强安全保证(如差分隐私、投毒抗性)与LAIMs的高准确率不相容。
- 质疑标准安全定义(如原始差分隐私)在涉及互联用户与虚假信息的现实场景中的充分性。
- 批判当前的缓解策略(如基于规则的过滤、微调与预提示)的不足,认为其缺乏严格的安保证。
- 呼吁暂停大规模LAIM的部署,并倡导通过监管、科研与开发者主导的改革,以防止社会危害。
提出的方法
- 分析LAIMs的结构性特征:依赖用户生成数据、高维记忆化,以及从高度异构的用户群体中学习。
- 借鉴私有统计与鲁棒统计中已确立的统计下界,表明强隐私与投毒鲁棒性会施加根本性的准确率限制。
- 论证作为基准的可信均值估计本身在高维与数据异构性下已不可避免地导致准确率下降。
- 批判标准差分隐私与数据投毒鲁棒性定义在存在协调虚假信息与虚假用户的真实场景中的局限性。
- 回顾当前缓解技术(如硬编码规则、微调、预提示)并得出结论:其无法提供可证明的安全性。
- 提出未来研究方向,包括构建包含人类判断的可信公共数据集,以及利用信任网络系统以认证数据来源。
实验结果
研究问题
- RQ1在现实数据条件下,大型人工智能模型能否同时实现高准确率与强安全保证?
- RQ2在高维、异构数据设置中,强制实施差分隐私与投毒鲁棒性时,准确率的根本统计限制是什么?
- RQ3为何标准的隐私与鲁棒性定义在存在虚假用户与虚假信息的现实AI部署环境中不足?
- RQ4当前的缓解技术(如微调与预提示)在在多大程度上能为LAIMs提供可证明的安全性?
- RQ5为防止不安全LAIMs的大规模部署,监管、研究与开发领域需要哪些系统性变革?
主要发现
- LAIMs的高准确率本质上与对训练数据的记忆化密切相关,尤其是在模型完全插值训练集的情况下。
- 实现强隐私(如差分隐私)与对数据投毒的鲁棒性,会导致不可避免的准确率下降,尤其在高维与异构数据设置中。
- 来自私有统计与鲁棒统计的现有统计下界表明,安全的LAIMs无法达到当前最先进模型的准确率水平。
- 原始差分隐私与投毒鲁棒性定义在现实部署中不足,因虚假用户与协调性虚假信息传播普遍存在。
- 当前的缓解策略(如基于规则的过滤、微调与预提示)无法提供可证明的安全保证,且对大规模部署而言不充分。
- 亟需对大规模LAIM部署实施暂停,并在商业化前实施监管认证与独立监督。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。