[論文レビュー] EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
EsoLang-Benchは、Brainfuck、Befunge-98、Whitespace、Unlambda、Shakespeareのようなエソテリック言語を用いて真の推論を評価し、記憶だけでは説明できないギャップを明らかにする。
Large language models achieve near-ceiling performance on code generation benchmarks, yet these results increasingly reflect memorization rather than genuine reasoning. We introduce EsoLang-Bench, a benchmark using five esoteric programming languages (Brainfuck, Befunge-98, Whitespace, Unlambda, and Shakespeare) that lack benchmark gaming incentives due to their economic irrationality for pre-training. These languages require the same computational primitives as mainstream programming but have 1,000-100,000x fewer public repositories than Python (based on GitHub search counts). We evaluate five frontier models across five prompting strategies and find a dramatic capability gap: models achieving 85-95% on standard benchmarks score only 0-11% on equivalent esoteric tasks, with 0% accuracy beyond the Easy tier. Few-shot learning and self-reflection fail to improve performance, suggesting these techniques exploit training priors rather than enabling genuine learning. EsoLang-Bench provides the first benchmark designed to mimic human learning by acquiring new languages through documentation, interpreter feedback, and iterative experimentation, measuring transferable reasoning skills resistant to data contamination.
研究の動機と目的
- 最小限の事前学習データしか持たない言語を用いて真の推論を評価する動機づけを行い、ベンチマークのデgamingを避ける。
- 5つのエソテリック言語で実装された4つの難易度レベルにまたがる80問題のデータセットを提供する。
- プロンプト戦略とエージェント的ツール使用がOOD推論性能に与える影響を評価する。
- 現在の最先端モデルの根本的な限界を理解するため、コンパイル・実行・ロジックのエラーモードを分析する。
提案手法
- Brainfuck、Befunge-98、Whitespace、Unlambda、Shakespeareで実装されたEasy、Medium、Hard、Extra-Hardの80問題を用意するエソ Lang-ベンチを作成する。
- Zero-Shot、Few-Shot、Self-Scaffolding、Textual Self-Scaffolding、ReActの5つのプロンプティング戦略の下で5つの最前線モデルを評価する。
- インタプリタのフィードバックループを持つCodex、Claude Codeなどのエージェント系システムをOODタスクでテストし、ツール使用の影響を研究する。
- 問題ごとに6つのテストケースとブートストラップ統計(3つの種、95%信頼区間)を用いた自動化されたインタプリタベース検証を使用する。
- コンパイル、実行、論理のエラーをカテゴリ化して、コアのボトルネックを特定する。
実験結果
リサーチクエスチョン
- RQ1LLMsは最小限の事前学習データ exposure でエソテリック言語への計算推論を転移できるか。
- RQ2インコンテキスト学習と高度なプロンプティングはOODのエソテリック言語性能を改善するか、それとも事前学習のカバレージが制約要因か。
- RQ3インタプリタとフィードバックループを持つエージェントシステムは、これらのOODタスクで非エージェント基準を上回るか。
- RQ4エソテリック言語の問題を解くときの支配的なエラーモード(コンパイル、実行、論理)は何か、そしてそれらはモデルの限界を何に示しているか。
主な発見
- フロンティアモデルには著しい能力ギャップがある:標準ベンチマークでの高性能がエソテリック言語タスクへは必ずしも منتقلされず(エソテリックタスクでの平均正答率0–11%)、という結果。
- すべてのモデルは構成を問わずMedium、Hard、Extra-Hardのエソテリック問題で0%を示し、Easyレベルの問題のみ一部成功。
- Self-scaffoldingは非エージェント系プロンプティングで最も良い成果を示し、言語/戦略の組み合わせによって最大約11.2%の正答率まで達するが、Pythonの性能には及ばない。
- Few-shot promptingはこの極端にリソースが少ない設定でほとんど有効性を示さず、ICLの有効性は事前学習データのカバレッージに依存するという仮説を支持する。
- インタプリタアクセスを持つエージェント系システムは非エージェント基準より2–3倍の改善をもたらすが、主流言語との同等性にはまだ達していない。
- エラーログ分析では、多くの言語でコンパイルエラーが優勢で、意味的(論理)エラーは構文を習得した場所で多く見られ、WhitespaceやUnlambdaのようなデータが最も乏しい言語ではコンパイル失敗がほぼ全体を占める。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。