Skip to main content
QUICK REVIEW

[논문 리뷰] On the Measure of Intelligence

François Chollet|arXiv (Cornell University)|2019. 11. 05.
Computability, Logic, AI Algorithms참고 문헌 48인용 수 10
한 줄 요약

이 논문은 알고리즘 정보 이론에 기반하여 지능을 기술 습득 효율성으로(formal definition of intelligence as skill-acquisition efficiency) 정의하고, 인간과 유사한 일반 지능을 측정하기 위한 벤치마크로 추상화 및 추론 코퍼스(ARC)를 제안한다. ARC는 사전 지식, 범위, 일반화 난이도를 표준화하여 공정한 비교를 가능하게 하며, 과제 중심의 기술에 국한되지 않고 광범위한 인지 능력을 평가할 수 있도록 한다.

ABSTRACT

To make deliberate progress towards more intelligent and more human-like artificial systems, we need to be following an appropriate feedback signal: we need to be able to define and evaluate intelligence in a way that enables comparisons between two systems, as well as comparisons with humans. Over the past hundred years, there has been an abundance of attempts to define and measure intelligence, across both the fields of psychology and AI. We summarize and critically assess these definitions and evaluation approaches, while making apparent the two historical conceptions of intelligence that have implicitly guided them. We note that in practice, the contemporary AI community still gravitates towards benchmarking intelligence by comparing the skill exhibited by AIs and humans at specific tasks such as board games and video games. We argue that solely measuring skill at any given task falls short of measuring intelligence, because skill is heavily modulated by prior knowledge and experience: unlimited priors or unlimited training data allow experimenters to "buy" arbitrary levels of skills for a system, in a way that masks the system's own generalization power. We then articulate a new formal definition of intelligence based on Algorithmic Information Theory, describing intelligence as skill-acquisition efficiency and highlighting the concepts of scope, generalization difficulty, priors, and experience. Using this definition, we propose a set of guidelines for what a general AI benchmark should look like. Finally, we present a benchmark closely following these guidelines, the Abstraction and Reasoning Corpus (ARC), built upon an explicit set of priors designed to be as close as possible to innate human priors. We argue that ARC can be used to measure a human-like form of general fluid intelligence and that it enables fair general intelligence comparisons between AI systems and humans.

연구 동기 및 목표

  • AI 연구에서 엄밀하고 실행 가능하며 정량적인 지능 정의가 부족한 문제를 해결하기 위해.
  • 현재의 벤치마크가 과제 중심의 기술에만 초점을 맞추고 있어 무한한 데이터와 사전 지식에 의해 기술 수준이 인위적으로 과대평가될 수 있는 한계를 극복하기 위해.
  • 핵심 지식 사전 지식과 일반화 난이도를 표준화하여 AI와 인간 지능 간의 공정한 비교를 가능하게 하는 벤치마크를 개발하기 위해.
  • 좁은 과제에서의 높은 기술 달성을 목표로 하는 연구에서, 인간과 유사한 광범위한 일반화 및 추상화 능력을 갖춘 시스템 개발로 연구 초점을 전환하기 위해.
  • 일반 AI 개발을 이끄는 공식적이고 정량적인 프레임워크를 알고리즘 정보 이론에 기반하여 제공하기 위해.

제안 방법

  • 지능을 기술 습득 효율성으로 정의하며, 지능은 시스템이 경험과 사전 지식으로부터 새로운 기술을 습득하는 속도로 간주된다.
  • 학습 성능을 종합적으로 평가하기 위해 계산, 시간, 에너지, 위험 효율성의 네 가지 효율 차원을 도입한다.
  • 알고리즘 정보 이론을 사용하여 최소 프로그램 길이와 압축 불가능한 복잡성으로 지능을 정량화하는 공식적 프레임워크를 수립한다.
  • 공통된 인간과 유사한 핵심 지식 사전 지식을 가정하는 태스크를 포함하여, 새로운 일반화가 필요한 추상화 및 추론 코퍼스(ARC)를 설계한다.
  • 기억을 시험하는 것이 아니라 일반화 능력을 시험하는 새로운, 도전적이며 해결 가능한 태스크를 생성하기 위해 교사-학생 학습 루프를 활용한다.
  • 모든 시험 수강자가 동일한 기초 지식을 가진다는 전제 하에 범위, 사전 지식, 경험을 통제하여 AI 시스템과 인간 간의 공정한 비교를 확보한다.

실험 결과

연구 질문

  • RQ1지능을 기술 습득 효율성으로 공식적으로 정의할 수 있는 방법은 무엇이며, 이는 단순술적 기술 기술이 아니라 실행 가능하고 측정 가능하며 설명 가능한가?
  • RQ2왜 과제 중심의 기술 측정은 일반 지능 평가에 부적합한가? 현재의 벤치마크 패러다임의 한계는 무엇인가?
  • RQ3사전 지식, 경험, 일반화 난이도를 공정하고 정량적으로 평가에 통합하기 위해 어떻게 체계적으로 고려할 수 있는가?
  • RQ4추상화 및 추론 코퍼스(ARC)가 인간과 유사한 일반 유동 지능을 측정하는 데 유효한 벤치마크로 기능할 수 있는 정도는 어느 정도인가?
  • RQ5핵심 지식 사전 지식이 인간과 인공지능 간의 공정하고 의미 있는 비교를 가능하게 하는 데 어떤 역할을 하는가?

주요 결과

  • 논문은 진정한 일반화 능력을 반영하기 위해 지능을 순수 기술 수준이 아니라 기술 습득 효율성으로 측정해야 한다고 규명한다.
  • 현재의 AI 벤치마크는 과제 중심의 성능에 의존하기 때문에 부적합하며, 무한한 데이터와 사전 지식이 허용되어 기술 수준이 인위적으로 과대평가되어 일반화 능력의 한계가 가려질 수 있다.
  • ARC 벤치마크는 인간이 해결할 수 있지만 현재의 기계 학습 모델(딥 러닝 포함)에 대해서는 해결이 곤란하여 광범위한 일반화 능력의 격차를 보여준다.
  • ARC는 인간과 유사한 핵심 지식 사전 지식(Core Knowledge)을 공유하는 방식으로 AI 시스템과 인간 간의 공정한 비교를 가능하게 한다.
  • 알고리즘 정보 이론에 기반한 공식적 프레임워크는 지능과 일반화 효율성에 대해 엄밀하고 정량적인 근거를 제공한다.
  • 새로움과 난이도를 고려한 태스크 생성을 통한 교사-학생 루프는 커리큘럼 학습과 일반 지능 평가에 대해 확장 가능하고 개방적인 접근법을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.