Skip to main content
QUICK REVIEW

[논문 리뷰] A Theoretically Grounded Benchmark for Evaluating Machine Commonsense

Henrique Santos, Ke Shen|arXiv (Cornell University)|2022. 03. 23.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 Gordon-Hobbs 공통의미 이론에 기반한 이론적으로 근거가 있는 공통지식 추론(TG-CSR)을 소개한다. 이는 공통지식 추론(CSR)을 평가하기 위한 최초의 벤치마크로, 시간, 공간, 감정, 목표 등 9개의 의미 카테고리에 걸쳐 소수의 예시를 사용한 문맥 및 주제 기반의 질문-답변 과제를 포함한다. 이는 단계적이고 점점 더 어려워지는 출시 방식을 통해 과적합을 방지하고 의미적 엄밀함을 확보하는 데에 기여하며, 初기 결과에서는 대규모 언어 모델조차도 통계적 패턴을 넘어서 의미적 엄밀함을 확보하는 데 어려움을 겪는 것으로 나타났다.

ABSTRACT

Programming machines with commonsense reasoning (CSR) abilities is a longstanding challenge in the Artificial Intelligence community. Current CSR benchmarks use multiple-choice (and in relatively fewer cases, generative) question-answering instances to evaluate machine commonsense. Recent progress in transformer-based language representation models suggest that considerable progress has been made on existing benchmarks. However, although tens of CSR benchmarks currently exist, and are growing, it is not evident that the full suite of commonsense capabilities have been systematically evaluated. Furthermore, there are doubts about whether language models are 'fitting' to a benchmark dataset's training partition by picking up on subtle, but normatively irrelevant (at least for CSR), statistical features to achieve good performance on the testing partition. To address these challenges, we propose a benchmark called Theoretically-Grounded Commonsense Reasoning (TG-CSR) that is also based on discriminative question answering, but with questions designed to evaluate diverse aspects of commonsense, such as space, time, and world states. TG-CSR is based on a subset of commonsense categories first proposed as a viable theory of commonsense by Gordon and Hobbs. The benchmark is also designed to be few-shot (and in the future, zero-shot), with only a few training and validation examples provided. This report discusses the structure and construction of the benchmark. Preliminary results suggest that the benchmark is challenging even for advanced language representation models designed for discriminative CSR question answering tasks. Benchmark access and leaderboard: https://codalab.lisn.upsaclay.fr/competitions/3080 Benchmark website: https://usc-isi-i2.github.io/TGCSR/

연구 동기 및 목표

  • 기계적 공통지식 추론(CSR)을 의미적으로 엄밀한 방식으로 평가하기 위한 이론적으로 근거가 있는 벤치마크의 부족을 해결하기 위해.
  • 진정한 의미적 이해를 포착하지 못하는 일시적인, 통계적으로 편향된 CSR 벤치마크의 한계를 극복하기 위해.
  • 데이터를 네 단계로 점차 더 어려워지는 방식으로 출시하여 과적합을 방지하는 벤치마크를 설계하기 위해.
  • Gordon-Hobbs 이론에서 유래한 공식적이고 온톨로지 기반의 공통지식 카테고리 분류 체계를 수립하여 질문 및 답변 구성의 지침을 제공하기 위해.
  • 경쟁 방식의 랭킹표를 통해 지속 가능하고 공개적인 평가를 가능하게 하여 장기적인 벤치마크 및 모델 개발을 지원하기 위해.

제안 방법

  • 벤치마크는 소수의 예시를 사용한 질문-답변(QA) 과제로 구성되며, 각 질문은 Gordon-Hobbs 이론의 특정 의미 카테고리(예: '감정' 또는 '시간')에 기반한다.
  • 각 QA 인스턴스는 맥락(예: '해외로의 휴가 계획')과 테마(예: '기내 지연')와 연관되어 있으며, 질문의 맥락적 기반을 제공한다.
  • 질문은 의미 일관성과 애매함 감소를 위해 9개의 핵심 공통지식 카테고리로 구성된 공식적 분류 체계를 사용하여 구성된다.
  • 벤치마크는 네 단계로 출시된다. 첫 번째 단계는 레이블이 포함된 훈련, 검증, 테스트 세트를 포함하며, 후속 단계에서는 점차 훈련 데이터를 줄이고 최종적으로 레이블이 없는 0-샷 단계로 이어진다.
  • 생성형 언어 모델을 평가하기 위해 프롬프트 템플릿을 사용하며, 답변은 정확하거나 거의 정확한 일치 여부로 진정한 답변과 비교하여 평가된다.
  • 수동 검토 절차를 통해 생성된 답변의 타당성과 의미 카테고리와의 일치 여부를 평가하며, 사전에 정의된 선택지와 일치하지 않더라도 이를 고려한다.

실험 결과

연구 질문

  • RQ1이론적으로 근거가 있는 공통지식 의미 이론에 기반한 벤치마크가 일시적인 벤치마크보다 더 엄밀하고 신뢰할 수 있는 기계적 공통지식 추론 평가를 가능하게 하는가?
  • RQ2감정이나 일정 설정과 같은 의미 카테고리에 기반한 질문의 의미적 근거가 순수한 통계적 패턴 매칭과 비교해 모델 성능에 어떤 영향을 미치는가?
  • RQ3대규모 언어 모델이 TG-CSR와 같은 의미적으로 근거가 있는 벤치마크에서 통계적 신호를 넘어서 일반화하지 못하는 정도는 어느 정도인가?
  • RQ4생성형 언어 모델은 사전에 정의된 선택지가 없더라도 유의미하고 인간과 유사한 답변을 생성할 수 있으며, 이러한 답변은 진정한 의미 카테고리와 어떻게 비교되는가?
  • RQ5단계적 출시 전략(최종 0-샷 단계 포함)은 과적합을 방지하고 모델이 데이터셋 특성에 의존하기보다 의미적 패턴을 이해하도록 유도하는 데 얼마나 효과적인가?

주요 결과

  • TG-CSR 벤치마크는 공통지식 추론의 질문-답변 인스턴스를 공식적인 이론, 특히 Gordon-Hobbs 의미 카테고리에 체계적으로 기반한 최초의 벤치마크이다.
  • 10억 파라미터가 넘는 언어 모델조차도 TG-CSR에서 인간 수준에 크게 못 미치는 성능을 보이며, 현재 모델들이 의미적 이해보다는 통계적 신호에 의존할 가능성이 있음을 시사한다.
  • 생성 모델은 사전에 정의된 선택지에 없는 타당한 답변을 자주 출력하며, 이는 생성 모델을 활용한 답변 확장 또는 데이터 증강에 잠재적 응용 가능성을 보여준다.
  • 인간 평가자들이 '예'로 판단한 많은 모델 출력이 '아니요'로 레이블링된 것으로 나타나, 소수의 예시 설정에서 모델 추론에 체계적인 편향이 존재함을 시사한다.
  • 최종 0-샷 단계를 포함한 단계적 출시 전략은 과적합을 효과적으로 완화하며, 모델이 훈련 데이터를 암기하는 것보다 의미적 패턴을 학습하도록 유도한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.