Skip to main content
QUICK REVIEW

[논문 리뷰] BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models

Yuzhe Tang|arXiv (Cornell University)|2026. 03. 16.
Artificial Intelligence in Healthcare and Education인용 수 0
한 줄 요약

BrainBench는 20개 범주에 걸친 100개의 두뇌 트릭 질문을 통해 LLM의 상식 추론 격차를 진단하고 표면적 휴리스틱 실패와 Claude 및 GPT 모델 간 가변성을 드러냅니다. 확장된 사고는 일부 범주에 도움이 되지만 다른 범주에는 해를 끼치며; 중국어의 다언어 간 결과에서도 유사한 결손이 나타납니다.

ABSTRACT

Large language models (LLMs) achieve impressive scores on standard benchmarks yet routinely fail questions that any human would answer correctly in seconds. We introduce BrainBench, a benchmark of 100 brainteaser questions spanning 20 carefully designed categories, each targeting a specific commonsense reasoning failure mode in LLMs. Categories range from implicit physical constraints ("Should I walk or drive my rental car to the return lot?") to semantic scope tricks and default assumption hijacks. We evaluate eight frontier models -- four from the Claude family and four from the GPT family -- using a zero-shot protocol with 10 independent runs per question. The best model, Claude Opus 4.6 with extended thinking, achieves only 80.3% accuracy; the worst, GPT-4o, scores 39.7%. Even top-performing models exhibit a 6-16 percentage-point gap between accuracy and consistency, revealing stochastic reasoning. Cross-lingual evaluation in Chinese shows most models degrade by 2-8 percentage points, confirming that these failures reflect reasoning deficits rather than language-specific artifacts. BrainBench provides a fine-grained diagnostic tool for identifying where and why LLMs substitute surface heuristics for genuine commonsense reasoning.

연구 동기 및 목표

  • LLM이 표면 휴리스틱에 의존하는 방식을 드러내는 20개 상식 추론 실패 범주체계를 개발한다.
  • 사람들에게는 쉽게 느껴지지만 LLM에게는 도전적인 목표 실패 모드를 다루는 100문항 벤치마크를 만든다.
  • 제로샷 프로토콜하에서 여덟 개의 최첨단 모델(Claude 및 GPT 계열)을 다수의 실행으로 평가하여 정확도와 일관성을 측정한다.
  • BrainBench의 영어 및 중국어 버전을 평가하여 다국어 강건성을 평가한다.

제안 방법

  • 핵심 함정, 근거 이유, 올바른 추론을 포함한 20개 실패 범주 체계를 정의한다.
  • 사람에게는 매우 쉽지만 LLM을 트랩에 빠뜨리는 카테고리당 5문항씩 100문항을 설계한다.
  • 질문당 모델별로 10회의 독립 실행(제로샷 프로토콜)을 사용하여 300개의 응답을 얻는다.
  • 정답 여부를 판단하는 LLM 판사를 사용하되 문장이 아닌-ground-truth 추론을 기준으로 한다.
  • 두 가지 측정 지표를 적용한다: 정확도(실행 간 올바른 비율)와 일관성(10회 모두에서 올바른 비율).
  • 벤치마크를 중국어로 번역하고 동일한 프로토콜로 평가하여 다국어 강건성을 시험한다.

실험 결과

연구 질문

  • RQ1가장 신뢰성 있게 frontier LLM과 인간을 구분하는 일반상식 추론 실패 모드는 무엇인가?
  • RQ2Claude 대 GPT 계열의 모델이 BrainBench에서 정확도, 일관성, 응답 안정성 측면에서 어떻게 비교되는가?
  • RQ3확장된 사고가 범주에 따라 성능을 향상시키는가 아니면 악화시키는가?
  • RQ4관찰된 추론 격차가 언어 특이적인가, 언어에 구애받지 않는가?

주요 결과

  • Claude 모델은 74–80% 정확도, GPT-5.4 모델은 70–74%, GPT-4o는 대략 40% 정확도입니다.
  • 가장 어려운 범주(암시적 물리적 제약 및 잘못된 시점)는 모델 간 평균 40% 정확도를 보입니다.
  • 확장된 사고는 전반적으로 약 +3 pp의 이익을 주지만 특정 범주에서 해를 끼칠 수 있어 과도한 사고의 역설이 나타납니다.
  • 다언어 평가에서 영어→중국어 평균 하락은 2.6 pp이며 Claude Opus 4.6은 때때로 중국어에서 개선되는 경우가 있습니다.
  • GPT 계열에서 GPT-4o에서 GPT-5.4로 31.0 pp의 점프가 있으며, Claude 모델은 변형 간에 더 작은 이득을 보입니다.
  • 일관성 격차(정확도와 일관성의 차이)가 존재하는 예가 있는데, 예를 들어 Claude Opus 4.6 Think는 정확도 80.3%이지만 일관성은 74.0%입니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.