Skip to main content
QUICK REVIEW

[논문 리뷰] Tests of Machine Intelligence

Shane Legg, Marcus Hütter|ArXiv.org|2007. 12. 22.
Computability, Logic, AI Algorithms참고 문헌 18인용 수 5
한 줄 요약

이 논문은 튜링 테스트를 초월한 기계 지능의 대체적 테스트 및 정의에 대한 첫 번째 종합적 서베이를 제시한다. 압축 테스트, 심리측도 평가, 보편적 지능 측도를 포함한 11가지 접근 방식을 평가한다. 알고리즘 복잡도와 강화 학습을 기반으로 한 형식적이고 객관적이며 근본적인 프레임워크인 보편적 지능을 도입하여 다양한 환경와 인지 능력에서 기계 지능을 수학적으로 엄밀한 기준으로 측정할 수 있도록 한다.

ABSTRACT

Although the definition and measurement of intelligence is clearly of fundamental importance to the field of artificial intelligence, no general survey of definitions and tests of machine intelligence exists. Indeed few researchers are even aware of alternatives to the Turing test and its many derivatives. In this paper we fill this gap by providing a short survey of the many tests of machine intelligence that have been proposed.

연구 동기 및 목표

  • 기계 지능 테스트와 정의에 대한 일반적 서베이가 부족하여 인공지능 분야의 이론적·실용적 진전이 저해된 바를 해결하기 위해.
  • 튜링 테스트의 지배적 지위를 도전하기 위해, 그 한계—예를 들어 속임수에 취약하고 인간 중심적이며 형식적 기반 부족—을 규명하기 위해.
  • 특히 보편적 지능과 같은 형식적이고 객관적이며 단순한 에이전트에서 초지능에 이르기까지 지능을 측정할 수 있는 대체 프레임워크를 제안하고 평가하기 위해.
  • 유효성, 보편성, 실용성, 형식적 명시성 등의 기준에 따라 기존 테스트들을 비교 분석할 수 있는 자료를 제공하기 위해.
  • 미래의 이론적·응용적 연구를 이끄는 데 기여하기 위해, 잘 정의되고 수학적으로 기반된 지능 측정 기준으로의 기본 전환을 촉구하기 위해.

제안 방법

  • 튜링 테스트, 압축 테스트, 언어 복잡도, 경쟁 게임, 심리측도 접근 방식을 포함한 11개의 기계 지능 테스트 및 정의를 서베이한다.
  • 알고리즘 확률과 보편적 사전을 사용하여 모든 가능한 계산 가능한 환경에서의 에이전트 성능을 기반으로 한 형식적 측정인 보편적 지능(Υ)을 도입한다.
  • 알고리즘 확률(코모고로프 복잡도)에 따라 가중치를 부여한 모든 환경에서의 성능을 종합하는 보편적 지능 측도 Υ를 정의한다.
  • 레빈의 Kt 복잡도를 사용하여 계산 가능한 환경에서 보편적 지능을 추정하는 실용적 근사치인 C-테스트를 제안한다.
  • 표준화된 평가 체계를 사용하여 유효성, 객관성, 보편성, 실용성 등 13개의 기준에 따라 각 테스트를 평가하여 상호 비교를 가능하게 한다.
  • 이론적 기준점으로 AIXI 에이전트를 사용한다: 최대 보편적 지능을 가지며 강화 학습 환경에서 강력한 최적성 성질을 증명한 에이전트이다.

실험 결과

연구 질문

  • RQ1튜링 테스트가 기계 지능 측정 기준으로서의 기초로 부적절한 이유는 무엇이며, 왜 그것으로는 충분하지 않은가?
  • RQ2기계 지능은 어떻게 형식적이고 객관적이며 인간 중심적이지 않은 방식으로 정의하고 측정할 수 있는가?
  • RQ3압축, 언어 복잡도, 또는 경쟁 게임과 같은 대체 테스트들이 지능의 타당성과 일반성 측면에서 얼마나 유효한가?
  • RQ4단순한 적응형 에이전트에서 초지능 시스템에 이르기까지 모든 수준을 아우르는 보편적 지능 측도를 구성할 수 있는가?
  • RQ5유효성, 보편성, 실용성, 형식적 명시성 등의 주요 차원에서 서로 다른 테스트들은 어떻게 비교 가능한가?

주요 결과

  • 튜링 테스트는 룩업 테이블을 통한 속임수에 취약하고 일반 지능이 아닌 인간 유사 행동을 우선시하기 때문에 지능 측정 기준으로서 근본적으로 결함이 있다.
  • 보편적 지능(Υ)은 알고리즘 확률과 코모고로프 복잡도를 사용하여 형식적으로 정의되며 보편적, 객관적, 근본적인 측도로서 가장 포괄적이고 이론적으로 타당한 측도이다.
  • C-테스트는 레빈의 Kt 복잡도를 사용하여 보편적 지능의 계산 가능한 근사치를 제공함으로써 실용적인 평가를 가능하게 하면서도 이론적 엄밀성을 유지한다.
  • 서베이된 테스트들 중에서 보편적 지능과 C-테스트만이 완전한 형식적 명시, 객관성, 보편성을 확보하고 있으며, 대부분의 다른 테스트들은 평가 기준의 50퍼센트 이상에서 실패한다.
  • AIXI 에이전트는 보편적 지능의 이론적 최대화자로서, 보편적 지능이 형식적으로 잘 정의되어 있음과 동시에 강화 학습 환경에서 강력한 최적성 성질을 지닌다는 것을 보여준다.
  • 이 서베이에서는 수십 년 간의 연구에도 불구하고, 널리 수용된 형식적이고 일반적인 기계 지능 테스트가 아직 존재하지 않는다는 것이 드러났다—이는 인공지능 연구 분야에서의 중요한 격차를 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.