Skip to main content
QUICK REVIEW

[논문 리뷰] Benchmarks for Automated Commonsense Reasoning: A Survey

Ernest Davis|arXiv (Cornell University)|2023. 02. 09.
Explainable Artificial Intelligence (XAI)인용 수 6
한 줄 요약

이 논문은 텍스트, 이미지, 영상 및 시뮬레이션 환경을 포함한 139개의 일반적 추론 벤치마크를 종합적으로 조사하여 설계 및 평가에 있어 심각한 결함을 밝혀냈다. 이는 전문 지식이 아닌 기초적 추론—시간적, 공간적, 물리적, 심리적, 사회적 추론—에 초점을 맞춘 고품질의 벤치마크 개발을 주장하며, 철저한 총괄, 多국어 테스트, 윤리적인 데이터 활용 방식을 통해 AI의 일반적 추론 능력을 신뢰할 수 있게 측정할 수 있도록 해야 한다고 촉구한다.

ABSTRACT

More than one hundred benchmarks have been developed to test the commonsense knowledge and commonsense reasoning abilities of artificial intelligence (AI) systems. However, these benchmarks are often flawed and many aspects of common sense remain untested. Consequently, we do not currently have any reliable way of measuring to what extent existing AI systems have achieved these abilities. This paper surveys the development and uses of AI commonsense benchmarks. We discuss the nature of common sense; the role of common sense in AI; the goals served by constructing commonsense benchmarks; and desirable features of commonsense benchmarks. We analyze the common flaws in benchmarks, and we argue that it is worthwhile to invest the work needed ensure that benchmark examples are consistently high quality. We survey the various methods of constructing commonsense benchmarks. We enumerate 139 commonsense benchmarks that have been developed: 102 text-based, 18 image-based, 12 video based, and 7 simulated physical environments. We discuss the gaps in the existing benchmarks and aspects of commonsense reasoning that are not addressed in any existing benchmark. We conclude with a number of recommendations for future development of commonsense AI benchmarks.

연구 동기 및 목표

  • 기존 AI 분야의 일반적 추론 벤치마크 생태계를 체계적으로 조사하고 분석하는 것.
  • AI 시스템의 일반적 추론 능력에 대한 신뢰할 수 있는 측정을 훼손하는 벤치마크 설계의 심각한 결함을 밝혀내는 것.
  • 일반 지식이나 전문 지식이 아닌 기초적 일반적 추론에 초점을 맞춘 고품질의 벤치마크 개발을 주장하는 것.
  • 총괄, 다국어 테스트, 윤리적인 데이터 관리 방식을 포함한 벤치마크 제작 최선의 실천 방안을 제안하는 것.
  • 벤치마크 성능과 실제 인간과 유사한 이해 사이의 괴리 문제를 다루는 것.

제안 방법

  • 텍스트(102개), 이미지(18개), 영상(12개), 시뮬레이션된 물리 환경(7개)의 4가지 모odal에서 139개의 벤치마크를 조사.
  • 기존 벤치마크의 설계 결함 분석, 예를 들어 모호한 질문, 지나치게 단순한 추론, 퍼즐 유형의 예시.
  • 벤치마크 목표, 바람직한 특성, 제작 기법 분석을 통해 일관성과 대표성 필요성 강조.
  • 고품질 벤치마크를 위한 기준 제안, 대표성 있는 샘플링, 최소한의 결함, 다양한 추론 유형 포함.
  • 벤치마크 제작자 및 심사자들이 예시 투명성, 결함 보고, 샘플 데이터셋 검토를 통해 품질 관리 강화를 권고.
  • AI 추론이 언어에 종속되는지 여부를 평가하기 위해 다국어 벤치마크 도입을 주장.

실험 결과

연구 질문

  • RQ1기존 일반적 추론 벤치마크의 설계 및 평가에서 나타나는 주요 단점은 무엇인가?
  • RQ2현재의 벤치마크가 진정으로 기초적 일반적 추론을 측정하는가, 아니면 표면적인 지식이나 패턴 매칭을 측정하는가?
  • RQ3벤치마크 품질을 체계적으로 향상시켜 AI 시스템 평가의 신뢰성과 의미를 확보할 수 있는 방법은 무엇인가?
  • RQ4왜 인간이 만든 퍼즐이나 시험 문제를 AI 시스템의 벤치마크로 사용하는 것이 문제시되는가?
  • RQ5AI 일반적 추론의 강건성과 일반화 능력을 평가하기 위해 다국어 평가가 어떤 역할을 해야 하는가?

주요 결과

  • 100개 이상의 벤치마크가 개발되었지만, 많은 경우 모호한 질문, 지나치게 단순한 추론, 또는 퍼즐 유형의 문제로 인해 심각한 결함을 야기한다.
  • 많은 벤치마크가 잘 알려진 뇌동물 퍼즐이나 발달심리학적 퍼즐에 의존하여, 대규모 언어 모델이 이를 암기할 수밖에 없으며 진정한 추론을 하지 못할 가능성이 있다.
  • 많은 벤치마크가 시간적, 공간적, 물리적, 심리적, 사회적 추론과 같은 기초적 일반적 추론을 시험하지 못하고, 오히려 일반 지식이나 백과사전식 지식에 치중되어 있다.
  • 본 논문은 현재의 벤치마크가 실제 이해의 신뢰할 수 있는 대체 측정 기준이 되지 못하며, 이로 인해 AI 연구 및 평가가 잘못된 방향으로 유도된다고 지적한다.
  • 심사자 및 연구 공동체는 특히 피어 리뷰 논문에서 사용되는 경우에 한해 결함이 있는 벤치마크를 더 적극적으로 식별하고 경고해야 한다.
  • 특히 무보수로 제공된 인간 노동에서 유래한 데이터를 벤치마크로 사용할 경우, 적절한 철회 기능이 없을 경우 윤리적 문제 발생 가능성이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.