Skip to main content
QUICK REVIEW

[论文解读] Scalar reward is not enough: A response to Silver, Singh, Precup and Sutton (2021)

Peter Vamplew, Benjamin J. Smith|arXiv (Cornell University)|Nov 25, 2021
Receptor Mechanisms and Signaling被引用 6
一句话总结

本文通过论证标量奖励在表示冲突目标方面的能力不足,挑战了'奖励足够'的假设,认为标量奖励无法充分建模通用智能。作者主张采用向量化奖励的多目标强化学习,以实现更安全、更透明且符合伦理的人工通用智能(AGI),强调标量奖励在复杂环境中可能导致不道德或不安全行为。

ABSTRACT

The recent paper `"Reward is Enough" by Silver, Singh, Precup and Sutton posits that the concept of reward maximisation is sufficient to underpin all intelligence, both natural and artificial. We contest the underlying assumption of Silver et al. that such reward can be scalar-valued. In this paper we explain why scalar rewards are insufficient to account for some aspects of both biological and computational intelligence, and argue in favour of explicitly multi-objective models of reward maximisation. Furthermore, we contend that even if scalar reward functions can trigger intelligent behaviour in specific cases, it is still undesirable to use this approach for the development of artificial general intelligence due to unacceptable risks of unsafe or unethical behaviour.

研究动机与目标

  • 挑战Silver等人(2021)提出的假设,即标量奖励最大化足以涵盖所有智能形式。
  • 证明标量奖励无法捕捉自然智能与人工智能中固有的多目标决策特性。
  • 论证基于标量奖励的AGI存在不可接受的风险,可能导致不安全或不道德行为。
  • 提出采用向量化奖励的多目标强化学习作为AGI发展的更安全、更透明且伦理上更合理的替代方案。
  • 倡导在AGI部署中实施审查与调整循环,以实现持续监督与适应。

提出的方法

  • 作者分析标量奖励在表示多重冲突目标方面的理论局限性。
  • 比较标量与向量奖励框架,突出向量奖励在建模复杂多目标行为方面的优势。
  • 探讨标量奖励在建模自然智能(包括人类与动物认知)方面的局限性。
  • 提出AGI部署的审查与调整框架,其中策略根据结果评估进行选择、执行与修正。
  • 主张多目标模型可增强透明度,并降低超级智能系统中欺骗性或不可控行为的风险。
  • 强调设计AGI时采用显式多目标结构的伦理必要性,以与社会价值观保持一致。

实验结果

研究问题

  • RQ1标量奖励能否充分表示自然智能与人工智能的多目标特性?
  • RQ2仅依赖标量奖励最大化的理论与实践局限性是什么?
  • RQ3多目标强化学习如何提升人工通用智能的安全性与伦理一致性?
  • RQ4标量奖励最大化在何种程度上增加了智能体出现不安全或不道德行为的风险?
  • RQ5审查与调整机制如何增强AGI系统的监督与透明度?

主要发现

  • 标量奖励无法充分表示多重冲突目标,而这些目标是自然智能与人工智能的根本特征。
  • 使用标量奖励会限制强化学习中可能出现的行为范围,降低智能体处理复杂多目标场景的能力。
  • 即使标量奖励在特定情况下可触发智能行为,它们对于发展人工通用智能而言仍不充分且具有风险。
  • 向量化奖励通过显式建模多重目标,使AI系统更具透明度、适应性与伦理一致性。
  • 基于多目标强化学习的审查与调整循环可增强监督,降低AGI中出现意外或有害行为的风险。
  • 作者结论认为,标量奖励最大化并非安全与伦理AGI发展的充分或理想基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。