[論文レビュー] BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models
BrainBenchは20カテゴリにわたる100問のブレインティージャーク問題を導入し、LLMの常識推論のギャップを診断。表面的なヒューリスティックの失敗とClaudeおよびGPTモデル間のばらつきが浮き彫りになり、拡張思考は一部のカテゴリで有益だが他には害となる。中国語での多言語横断結果も同様の欠陥を示す。
Large language models (LLMs) achieve impressive scores on standard benchmarks yet routinely fail questions that any human would answer correctly in seconds. We introduce BrainBench, a benchmark of 100 brainteaser questions spanning 20 carefully designed categories, each targeting a specific commonsense reasoning failure mode in LLMs. Categories range from implicit physical constraints ("Should I walk or drive my rental car to the return lot?") to semantic scope tricks and default assumption hijacks. We evaluate eight frontier models -- four from the Claude family and four from the GPT family -- using a zero-shot protocol with 10 independent runs per question. The best model, Claude Opus 4.6 with extended thinking, achieves only 80.3% accuracy; the worst, GPT-4o, scores 39.7%. Even top-performing models exhibit a 6-16 percentage-point gap between accuracy and consistency, revealing stochastic reasoning. Cross-lingual evaluation in Chinese shows most models degrade by 2-8 percentage points, confirming that these failures reflect reasoning deficits rather than language-specific artifacts. BrainBench provides a fine-grained diagnostic tool for identifying where and why LLMs substitute surface heuristics for genuine commonsense reasoning.
研究の動機と目的
- LLMが表層的ヒューリスティックに依存することを露呈させる20の常識推論失敗カテゴリの分類法を開発する。
- 人間にとっては容易だがLLMにとって困難なターゲット失敗モードを網羅する100問ベンチマークを作成する。
- ゼロショットプロトコルの下で8つのフロンティアモデル(ClaudeおよびGPTファミリー)を複数回実行して正確さと一貫性を評価する。
- BrainBenchの英語版と中国語版を評価してクロス言語の頑健性を測定する。
提案手法
- 20の失敗カテゴリ分類法を定義し、コア・トラップ、根拠、正しい推論を明示する。
- 各カテゴリ5問ずつ計画し、 humansには極めて容易だがLLMを罠にはまらせる設問を設計する。
- 質問ごとにモデルごとに10回の独立実行を用いた厳密なゼロショットプロトコルを適用する(モデルあたり300回答)。
- 正誤は表現ではなく根拠となる推論で決定するLLMジャッジを用いる。
- 2つの指標を測定する:正確さ(リトライ全体での正解の割合)と一貫性(10回すべてで正解である割合)。
- ベンチマークを中国語に翻訳し、同じプロトコルで評価してクロス言語の頑健性を testする。
実験結果
リサーチクエスチョン
- RQ1どの常識推論の失敗モードが frontier LLMs と人間を最も確実に識別するか?
- RQ2異なるモデルファミリー(Claude vs GPT)はBrainBenchにおける正確さ・一貫性・応答安定性でどう比較されるか?
- RQ3拡張思考はカテゴリごとに性能を向上させるか、低下させるか?
- RQ4観察された推論ギャップは言語特有か、それとも言語非依存か?
主な発見
- Claudeモデルは74–80%の正確さ、GPT-5.4モデルは70–74%、GPT-4oは約40%の正確さ。
- 最も難しいカテゴリ(暗黙の物理的制約と誤った視点)はモデル間で平均40%の正確さ。
- 拡張思考は全体で約+3ppだが、特定のカテゴリでは害になる可能性があり、過剰思考の逆説を示唆。
- クロス言語評価ではEnglish→Chineseの平均低下が2.6pp、Claude Opus 4.6は中国語で時に改善することがある。
- GPTファミリ内でGPT-4oからGPT-5.4へのジャンプは31.0pp、一方Claudeモデルはバリアント間でより小さな向上。
- 一貫性のギャップ(正確さ minus 一貫性)が顕著に存在し、例: Claude Opus 4.6 Thinkは80.3%の正確さだが74.0%の一貫性。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。