Skip to main content
QUICK REVIEW

[论文解读] The Offense-Defense Balance of Scientific Knowledge: Does Publishing AI Research Reduce Misuse?

Toby Shevlane, Allan Dafoe|arXiv (Cornell University)|Dec 27, 2019
Adversarial Robustness in Machine Learning参考文献 11被引用 8
一句话总结

本文提出一个理论框架,用以评估发布人工智能研究是增加还是减少滥用风险,认为与计算机安全不同,由于攻击者和防御者都更可能事先掌握相关知识,披露在人工智能领域带来的安全收益可能更弱。文章呼吁人工智能界设计契合人工智能独特技术与社会动态的披露规范,而非简单照搬软件漏洞披露的规范。

ABSTRACT

There is growing concern over the potential misuse of artificial intelligence (AI) research. Publishing scientific research can facilitate misuse of the technology, but the research can also contribute to protections against misuse. This paper addresses the balance between these two effects. Our theoretical framework elucidates the factors governing whether the published research will be more useful for attackers or defenders, such as the possibility for adequate defensive measures, or the independent discovery of the knowledge outside of the scientific community. The balance will vary across scientific fields. However, we show that the existing conversation within AI has imported concepts and conclusions from prior debates within computer security over the disclosure of software vulnerabilities. While disclosure of software vulnerabilities often favours defence, this cannot be assumed for AI research. The AI research community should consider concepts and policies from a broad set of adjacent fields, and ultimately needs to craft policy well-suited to its particular challenges.

研究动机与目标

  • 探讨人工智能研究披露中的攻防平衡,评估发布是否更有利于攻击者而非防御者。
  • 挑战人工智能研究披露规范应模仿计算机安全领域(尤其是漏洞披露)规范的假设。
  • 识别决定发布是增强还是削弱安全性的关键因素,如事前掌握能力、防御可行性以及独立发现潜力。
  • 指导人工智能研究界制定兼顾开放性与滥用防范的上下文相关披露规范。
  • 鼓励发展可随人工智能能力提升而扩展的治理机制,并优先考虑社会利益。

提出的方法

  • 基于攻防动态构建理论框架,借鉴计算机安全、生物安全和密码学的类比。
  • 通过四个关键因素评估披露影响:防御措施的可行性、攻击者与防御者的事前掌握能力、独立发现潜力以及保护成本。
  • 以GPT-2语言模型的披露为例,进行案例研究,说明框架在现实中的应用。
  • 通过对比分析突出软件漏洞与人工智能研究之间的差异,特别是在知识可及性和复制成本方面。
  • 框架纳入制度因素,如大型科技公司在独立开发防御措施中的作用。
  • 该方法强调基于上下文的政策设计,而非通用适用的规范。

实验结果

研究问题

  • RQ1在何种条件下,发布人工智能研究会增加滥用风险而非降低风险?
  • RQ2人工智能研究中的攻防平衡与计算机安全漏洞披露中的攻防平衡有何不同?
  • RQ3防御者在无发布的情况下,能在多大程度上独立复现人工智能研究,从而降低披露的安全价值?
  • RQ4大型科技公司等制度性行为者在事前防御开发中扮演何种角色?
  • RQ5人工智能研究界如何设计既有效又可持续的披露规范,以适应人工智能能力的持续演进?

主要发现

  • 发布人工智能研究的安全价值可能弱于计算机安全领域,因为在后者中,披露通常能快速促成补丁修复。
  • 针对人工智能滥用的防御措施(如检测系统)往往成本高昂,且未必广泛部署,从而降低了发布的收益。
  • 许多防御者,尤其是大型科技公司,很可能独立发现与研究人员相同的洞察,从而削弱发布对防御的独有价值。
  • 攻击者(包括国家行为体)也可能独立复现人工智能研究,从而增加发布带来的滥用风险。
  • 科学界之外的独立发现潜力降低了披露的净安全效益,尤其是在防御措施实施成本高昂时。
  • 人工智能研究界应避免直接套用计算机安全规范,而应发展契合人工智能独特技术与社会动态的治理框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。