[论文解读] Open-Sourcing Highly Capable Foundation Models: An evaluation of risks, benefits, and alternative methods for pursuing open-source objectives
本文评估了开源高度能力基础模型的风险与收益,认为对于某些先进模型而言,极端风险(如在生物或网络攻击中被恶意利用)可能超过开源带来的益处。文章主张采用基于风险的方法,建议谨慎决定模型发布,并采用受控访问或研究API等替代共享方式,在保持开放性的同时最小化危害。
Recent decisions by leading AI labs to either open-source their models or to restrict access to their models has sparked debate about whether, and how, increasingly capable AI models should be shared. Open-sourcing in AI typically refers to making model architecture and weights freely and publicly accessible for anyone to modify, study, build on, and use. This offers advantages such as enabling external oversight, accelerating progress, and decentralizing control over AI development and use. However, it also presents a growing potential for misuse and unintended consequences. This paper offers an examination of the risks and benefits of open-sourcing highly capable foundation models. While open-sourcing has historically provided substantial net benefits for most software and AI development processes, we argue that for some highly capable foundation models likely to be developed in the near future, open-sourcing may pose sufficiently extreme risks to outweigh the benefits. In such a case, highly capable foundation models should not be open-sourced, at least not initially. Alternative strategies, including non-open-source model sharing options, are explored. The paper concludes with recommendations for developers, standard-setting bodies, and governments for establishing safe and responsible model sharing practices and preserving open-source benefits where safe.
研究动机与目标
- 评估开源高度能力基础模型是否会造成不可接受的风险,这些风险可能超过透明度与协作带来的益处。
- 考察开源如何因增加攻击者对漏洞和防护机制的了解,而加剧极端风险,例如促进武器开发或大规模虚假信息传播。
- 探索替代性、更安全的共享方式,以实现开源目标(如监督与创新),而无需完全公开模型权重,例如分阶段发布、研究API和安全协作。
- 为开发者、监管机构和标准制定机构提供关于负责任模型共享实践的可操作建议。
- 倡导从全面开源转向基于情境、基于风险的决策模式,特别是在具有高社会影响潜力的模型发布方面。
提出的方法
- 对开源与受限模型共享进行对比分析,重点关注AI滥用场景中的攻防动态。
- 评估模型权重和架构访问在使恶意行为者能够禁用安全功能并微调模型用于有害目的方面的作用。
- 提出替代性模型共享机制,包括受控访问、研究API和分阶段发布,以在透明度与风险缓解之间取得平衡。
- 分析法律与政策工具,如责任制度和部署前监管,以在不完全依赖自愿开源的前提下强制执行安全标准。
- 整合治理、AI安全与政策研究的洞见,构建负责任模型发布决策的框架。
- 利用案例研究和AI能力的新兴趋势,预测开源日益强大模型可能带来的未来风险。

实验结果
研究问题
- RQ1在何种条件下,开源高度能力基础模型的风险会超过透明度与协作带来的益处?
- RQ2开源如何改变AI滥用中的攻防平衡,特别是在武器化、网络攻击和虚假信息传播方面?
- RQ3有哪些替代性模型共享策略可以在降低滥用风险的同时,保留开源的关键优势(如监督与创新)?
- RQ4如何设计监管与责任框架,以确保负责任的模型发布,同时不抑制创新?
- RQ5开发者与监管机构应依据哪些标准判断,即使模型能力极强,也不应被开源?
主要发现
- 对于高度能力的基础模型,开源可能带来极端风险,例如促进生物或化学武器的开发,或引发大规模网络攻击,这些风险可能超过透明度与协作带来的益处。
- 开源会增加模型缺陷在下游传播的风险,并使恶意行为者更容易通过微调或权重操纵绕过安全机制。
- 对于先进模型,AI滥用中的攻防平衡正向进攻倾斜,因为开源为攻击者提供了关于漏洞和攻击面的详细知识。
- 替代性共享方式(如分阶段发布、研究API和受控访问)可在降低风险的同时实现许多开源目标,尽管可能限制更广泛社区的参与。
- 监管是强制执行部署前安全合规的必要手段,而仅靠责任制度不足以应对滥用案例中的归属与因果关系挑战。
- 模型发布决策应基于全面的风险评估,并能随安全能力的演变与社会韧性水平的变化而动态调整。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。