Skip to main content
QUICK REVIEW

[论文解读] Tests of Machine Intelligence

Shane Legg, Marcus Hütter|ArXiv.org|Dec 22, 2007
Computability, Logic, AI Algorithms参考文献 18被引用 5
一句话总结

本文首次全面综述了超越图灵测试的机器智能替代测试与定义,评估了包括压缩测试、心理测量评估和通用智能度量在内的11种方法。它提出了通用智能作为基于算法复杂性和强化学习的正式、客观且基础性的框架,为在多样化环境和认知能力下测量机器智能提供了数学上严谨的标准。

ABSTRACT

Although the definition and measurement of intelligence is clearly of fundamental importance to the field of artificial intelligence, no general survey of definitions and tests of machine intelligence exists. Indeed few researchers are even aware of alternatives to the Turing test and its many derivatives. In this paper we fill this gap by providing a short survey of the many tests of machine intelligence that have been proposed.

研究动机与目标

  • 为解决缺乏对机器智能测试与定义的全面综述这一问题,该问题已阻碍人工智能的理论与实践进展。
  • 通过识别图灵测试的局限性(如易受欺骗、人类中心主义、缺乏形式基础),挑战其主导地位。
  • 提出并评估替代框架(尤其是通用智能),这些框架具有形式化、客观性,并能衡量从简单智能体到超级智能系统的智能水平。
  • 为研究人员提供基于有效性、通用性、实用性及形式化规范等标准的现有测试的对比分析。
  • 倡导人工智能研究的根本性转变,采用明确定义、数学基础坚实的智能度量标准,以指导未来理论与应用研究。

提出的方法

  • 系统调研了11种不同的机器智能测试与定义,包括图灵测试、压缩测试、语言复杂性、对抗性游戏以及心理测量方法。
  • 提出通用智能(Υ)作为基于智能体在所有可计算环境中的表现的正式度量,利用算法概率和通用先验。
  • 通过通用智能度量Υ定义通用智能,该度量聚合了所有环境中的表现,权重为它们的算法概率(柯尔莫哥洛夫复杂度)。
  • 提出C-Test作为通用智能的实用近似,利用莱温的Kt复杂度在可计算环境中估计通用智能。
  • 使用标准化评分系统,沿13项标准(如有效性、客观性、通用性、实用性)评估每种测试,以实现跨比较。
  • 使用AIXI智能体作为理论基准:最大通用智能智能体,已被证明在强化学习环境中具备强最优性。

实验结果

研究问题

  • RQ1图灵测试作为机器智能度量标准的根本缺陷是什么?为何其不足以作为基础性标准?
  • RQ2如何以形式化、客观且非人类中心化的方式定义和测量机器智能?
  • RQ3压缩、语言复杂性或对抗性游戏等替代测试在多大程度上可作为有效且通用的智能度量?
  • RQ4能否构建一个涵盖从简单适应性智能体到超级智能系统的通用智能度量?
  • RQ5不同测试在有效性、通用性、实用性及形式化规范等关键维度上的表现如何比较?

主要发现

  • 图灵测试作为智能度量标准存在根本性缺陷,因其易受查表攻击欺骗,且偏向人类行为而非通用智能。
  • 通用智能(Υ)是最全面且理论基础最坚实的度量标准,因其基于算法概率与柯尔莫哥洛夫复杂度进行形式化定义,具备通用性、客观性与基础性。
  • C-Test通过利用莱温的Kt复杂度,为通用智能提供了可计算的近似,使其在现实世界评估中具有实用性,同时保持理论严谨性。
  • 在所调研的测试中,仅有通用智能和C-Test实现了完整的正式规范、客观性与通用性,而大多数其他测试在至少50%的评估标准上失败。
  • AIXI智能体是通用智能的理论最大值智能体,证明通用智能不仅形式定义严谨,且在强化学习环境中具备强最优性。
  • 该综述揭示,尽管经过数十年研究,目前仍缺乏广泛接受、形式化且通用的机器智能测试——凸显了人工智能研究中的关键空白。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。