Skip to main content
QUICK REVIEW

[論文レビュー] BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models

Yuzhe Tang|arXiv (Cornell University)|Mar 16, 2026
Artificial Intelligence in Healthcare and Education被引用数 0
ひとこと要約

BrainBenchは20カテゴリにわたる100問のブレインティージャーク問題を導入し、LLMの常識推論のギャップを診断。表面的なヒューリスティックの失敗とClaudeおよびGPTモデル間のばらつきが浮き彫りになり、拡張思考は一部のカテゴリで有益だが他には害となる。中国語での多言語横断結果も同様の欠陥を示す。

ABSTRACT

Large language models (LLMs) achieve impressive scores on standard benchmarks yet routinely fail questions that any human would answer correctly in seconds. We introduce BrainBench, a benchmark of 100 brainteaser questions spanning 20 carefully designed categories, each targeting a specific commonsense reasoning failure mode in LLMs. Categories range from implicit physical constraints ("Should I walk or drive my rental car to the return lot?") to semantic scope tricks and default assumption hijacks. We evaluate eight frontier models -- four from the Claude family and four from the GPT family -- using a zero-shot protocol with 10 independent runs per question. The best model, Claude Opus 4.6 with extended thinking, achieves only 80.3% accuracy; the worst, GPT-4o, scores 39.7%. Even top-performing models exhibit a 6-16 percentage-point gap between accuracy and consistency, revealing stochastic reasoning. Cross-lingual evaluation in Chinese shows most models degrade by 2-8 percentage points, confirming that these failures reflect reasoning deficits rather than language-specific artifacts. BrainBench provides a fine-grained diagnostic tool for identifying where and why LLMs substitute surface heuristics for genuine commonsense reasoning.

研究の動機と目的

  • LLMが表層的ヒューリスティックに依存することを露呈させる20の常識推論失敗カテゴリの分類法を開発する。
  • 人間にとっては容易だがLLMにとって困難なターゲット失敗モードを網羅する100問ベンチマークを作成する。
  • ゼロショットプロトコルの下で8つのフロンティアモデル(ClaudeおよびGPTファミリー)を複数回実行して正確さと一貫性を評価する。
  • BrainBenchの英語版と中国語版を評価してクロス言語の頑健性を測定する。

提案手法

  • 20の失敗カテゴリ分類法を定義し、コア・トラップ、根拠、正しい推論を明示する。
  • 各カテゴリ5問ずつ計画し、 humansには極めて容易だがLLMを罠にはまらせる設問を設計する。
  • 質問ごとにモデルごとに10回の独立実行を用いた厳密なゼロショットプロトコルを適用する(モデルあたり300回答)。
  • 正誤は表現ではなく根拠となる推論で決定するLLMジャッジを用いる。
  • 2つの指標を測定する:正確さ(リトライ全体での正解の割合)と一貫性(10回すべてで正解である割合)。
  • ベンチマークを中国語に翻訳し、同じプロトコルで評価してクロス言語の頑健性を testする。

実験結果

リサーチクエスチョン

  • RQ1どの常識推論の失敗モードが frontier LLMs と人間を最も確実に識別するか?
  • RQ2異なるモデルファミリー(Claude vs GPT)はBrainBenchにおける正確さ・一貫性・応答安定性でどう比較されるか?
  • RQ3拡張思考はカテゴリごとに性能を向上させるか、低下させるか?
  • RQ4観察された推論ギャップは言語特有か、それとも言語非依存か?

主な発見

  • Claudeモデルは74–80%の正確さ、GPT-5.4モデルは70–74%、GPT-4oは約40%の正確さ。
  • 最も難しいカテゴリ(暗黙の物理的制約と誤った視点)はモデル間で平均40%の正確さ。
  • 拡張思考は全体で約+3ppだが、特定のカテゴリでは害になる可能性があり、過剰思考の逆説を示唆。
  • クロス言語評価ではEnglish→Chineseの平均低下が2.6pp、Claude Opus 4.6は中国語で時に改善することがある。
  • GPTファミリ内でGPT-4oからGPT-5.4へのジャンプは31.0pp、一方Claudeモデルはバリアント間でより小さな向上。
  • 一貫性のギャップ(正確さ minus 一貫性)が顕著に存在し、例: Claude Opus 4.6 Thinkは80.3%の正確さだが74.0%の一貫性。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。