[论文解读] Towards Publicly Accountable Frontier LLMs: Building an External Scrutiny Ecosystem under the ASPIRE Framework
本文提出了 ASPIRE 框架——访问权限、搜索态度、风险对称性、独立性、资源保障和专业能力——以制度化地实现对前沿大语言模型的外部审查。该文主张,由审计员、研究人员和公民社会等外部主体开展的民主化、可信的评估对于公共问责至关重要,并阐述了如何通过贯穿人工智能全生命周期的结构化审查来改善治理并降低强大人工智能系统带来的系统性风险。
With the increasing integration of frontier large language models (LLMs) into society and the economy, decisions related to their training, deployment, and use have far-reaching implications. These decisions should not be left solely in the hands of frontier LLM developers. LLM users, civil society and policymakers need trustworthy sources of information to steer such decisions for the better. Involving outside actors in the evaluation of these systems - what we term 'external scrutiny' - via red-teaming, auditing, and external researcher access, offers a solution. Though there are encouraging signs of increasing external scrutiny of frontier LLMs, its success is not assured. In this paper, we survey six requirements for effective external scrutiny of frontier AI systems and organize them under the ASPIRE framework: Access, Searching attitude, Proportionality to the risks, Independence, Resources, and Expertise. We then illustrate how external scrutiny might function throughout the AI lifecycle and offer recommendations to policymakers.
研究动机与目标
- 应对前沿大语言模型开发中日益增长的公共问责需求,因其可能引发高风险的社会影响,如虚假信息、监控和滥用。
- 识别仅依赖人工智能开发者进行风险评估的局限性,因其存在利益冲突和信息不对称问题。
- 提出一种结构化的治理框架——ASPIRE,使独立主体能够开展有效且可信的外部审查。
- 支持政策制定者设计机制,确保外部审查系统化、资源充足,并能为监管与监督提供依据。
- 通过让研究人员、公民社会和审计员等多元利益相关方参与评估与塑造前沿人工智能系统,推动人工智能治理的民主化。
提出的方法
- 将 ASPIRE 框架开发为六维治理工具:访问权限、搜索态度、风险对称性、独立性、资源保障和专业能力。
- 对审查所必需的关键信息类型进行分类与分析:模型能力、可控性、影响、模型权重、内部结构、训练数据、系统组件以及第三方影响数据。
- 倡导分层访问模式,包括通过 API 访问基础模型和元数据,同时平衡安全与透明度的关切。
- 提出隐私保护型数据共享机制,与第三方(如社交媒体平台)合作,以研究虚假信息等现实世界影响。
- 整合模型卡片与系统卡片作为标准化文档,用于共享训练数据、计算资源和测试结果等元信息。
- 将外部审查视为贯穿人工智能全生命周期——开发、部署和部署后阶段——的持续过程,通过红队测试、审计和独立研究实现。

实验结果
研究问题
- RQ1如何制度化外部审查,以确保前沿大语言模型开发的公共问责?
- RQ2外部主体要有效评估前沿大语言模型,需要哪些具体的信息类型和访问级别?
- RQ3外部审查如何克服开发者提供的风险评估中固有的信息不对称与隐瞒激励?
- RQ4为确保外部审查具备独立性、充分资源和技术能力,需要哪些结构性与程序性保障?
- RQ5外部审查在哪些方面可为政策决策提供支持,并改善前沿大语言模型的安全性与社会影响?
主要发现
- 通过红队测试、审计和独立研究进行的外部审查,对于验证开发者声明并发现其可能遗漏或隐瞒的风险至关重要。
- 对基础模型、模型族、内部结构、训练数据和系统组件的访问,有助于深入理解模型行为、能力与失效模式。
- ASPIRE 框架为设计与风险相称、建立在独立性与专业能力之上的有效外部审查体系,提供了全面且可操作的结构。
- 即使设计精良的审查也无法识别所有风险,其影响力取决于能否真正影响决策,凸显了仅靠审查本身不足以解决问题,还需更广泛的制度性杠杆。
- 第三方数据共享,尤其是与社交媒体平台等机构的合作,对于评估虚假信息等现实世界影响至关重要,但需采用隐私保护机制。
- 模型卡片与系统卡片是提升透明度的宝贵工具,但其公开可用性必须与防止扩散与滥用的风险相权衡。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。