Skip to main content
QUICK REVIEW

[论文解读] An overview of 11 proposals for building safe advanced AI

Evan Hubinger|arXiv (Cornell University)|Dec 4, 2020
Ethics and Social Impacts of AI被引用 6
一句话总结

本文在当前机器学习范式下,评估了11种构建安全高级人工智能的提案,重点关注外部对齐、内部对齐、训练竞争力和性能竞争力。论文提出了一种比较框架,用于评估对齐安全性与实际可行性,揭示了如强化学习增强的蒸馏法与宽松对抗训练等混合方法的优势,这些方法在保持对齐特性的同时,提升了监督能力与可扩展性。

ABSTRACT

This paper analyzes and compares 11 different proposals for building safe advanced AI under the current machine learning paradigm, including major contenders such as iterated amplification, AI safety via debate, and recursive reward modeling. Each proposal is evaluated on the four components of outer alignment, inner alignment, training competitiveness, and performance competitiveness, of which the distinction between the latter two is introduced in this paper. While prior literature has primarily focused on analyzing individual proposals, or primarily focused on outer alignment at the expense of inner alignment, this analysis seeks to take a comparative look at a wide range of proposals including a comparative analysis across all four previously mentioned components.

研究动机与目标

  • 为在当前机器学习范式下构建安全高级人工智能的11种领先提案提供统一的比较评估。
  • 通过同时分析外部对齐与内部对齐,以及训练竞争力与性能竞争力,弥补先前文献中的不平衡。
  • 提出并阐明训练竞争力与性能竞争力之间的区别,作为评估人工智能安全提案的关键维度。
  • 评估结合模仿学习、强化学习、监督机制与透明性工具的混合方法,以提升对齐性与可扩展性。
  • 基于对齐鲁棒性与现实可行性,为未来人工智能安全提案的评估提供结构化框架。

提出的方法

  • 每项提案均通过四个组成部分进行分析:外部对齐、内部对齐、训练竞争力与性能竞争力。
  • 论文评估了如附加强化学习目标的蒸馏法与宽松对抗训练等混合方法,以提升监督能力与模型可靠性。
  • 在多个方法中整合了透明性工具,以增强可解释性,并支持对模型行为的监督。
  • 应用宽松对抗训练以检测并缓解模型中的欺骗性或灾难性行为。
  • 采用损失函数的退火策略,引导模型趋向期望行为,例如在理想情况下限制为HCH。
  • 通过训练模型预测其他模型(如π)的行为,以提升监督能力,尤其在强化学习增强的蒸馏框架中。

实验结果

研究问题

  • RQ1不同人工智能安全提案在外部对齐、内部对齐、训练竞争力与性能竞争力维度上的表现如何比较?
  • RQ2结合模仿学习、强化学习与监督机制的混合方法是否能提升对齐性与可扩展性?
  • RQ3透明性工具与宽松对抗训练在多大程度上能增强先进人工智能系统中监督的可靠性?
  • RQ4在对齐提案中,训练竞争力与性能竞争力之间的权衡是什么?
  • RQ5将损失函数退火至模仿行为或HCH类行为,对最终模型的对齐性与性能有何影响?

主要发现

  • 如附加强化学习目标的蒸馏法与宽松对抗训练等混合方法,在理想情况下通过限制为HCH,可实现强大的外部对齐,尤其在模仿损失被退火时效果更显著。
  • 当监督模型(如Amp(M))能够同时预测策略π及其行为时,内部对齐显著改善,尤其是在结合透明性工具与预测损失训练的情况下。
  • 使用强化学习进行策略训练可提升训练竞争力,但若监督训练不稳定或成本过高,蒸馏与策略模型的联合训练可能降低竞争力。
  • 当最终模型收敛至HCH类行为时,性能竞争力得以保持,确保系统能够满足核心通用人工智能使用场景。
  • 使用预测损失而非完整强化学习目标有助于维持模型的短视性,降低策略模型中欺骗性对齐的风险。
  • 在Amp(M)具备预测灾难性行为能力的前提下,宽松对抗训练与Amp(M)对π的监督相结合,可有效检测并抑制灾难性行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。