Skip to main content
QUICK REVIEW

[論文レビュー] EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages

Aman Sharma, Paras Chopra|arXiv (Cornell University)|Mar 10, 2026
Machine Learning in Materials Science被引用数 0
ひとこと要約

EsoLang-Benchは、Brainfuck、Befunge-98、Whitespace、Unlambda、Shakespeareのようなエソテリック言語を用いて真の推論を評価し、記憶だけでは説明できないギャップを明らかにする。

ABSTRACT

Large language models achieve near-ceiling performance on code generation benchmarks, yet these results increasingly reflect memorization rather than genuine reasoning. We introduce EsoLang-Bench, a benchmark using five esoteric programming languages (Brainfuck, Befunge-98, Whitespace, Unlambda, and Shakespeare) that lack benchmark gaming incentives due to their economic irrationality for pre-training. These languages require the same computational primitives as mainstream programming but have 1,000-100,000x fewer public repositories than Python (based on GitHub search counts). We evaluate five frontier models across five prompting strategies and find a dramatic capability gap: models achieving 85-95% on standard benchmarks score only 0-11% on equivalent esoteric tasks, with 0% accuracy beyond the Easy tier. Few-shot learning and self-reflection fail to improve performance, suggesting these techniques exploit training priors rather than enabling genuine learning. EsoLang-Bench provides the first benchmark designed to mimic human learning by acquiring new languages through documentation, interpreter feedback, and iterative experimentation, measuring transferable reasoning skills resistant to data contamination.

研究の動機と目的

  • 最小限の事前学習データしか持たない言語を用いて真の推論を評価する動機づけを行い、ベンチマークのデgamingを避ける。
  • 5つのエソテリック言語で実装された4つの難易度レベルにまたがる80問題のデータセットを提供する。
  • プロンプト戦略とエージェント的ツール使用がOOD推論性能に与える影響を評価する。
  • 現在の最先端モデルの根本的な限界を理解するため、コンパイル・実行・ロジックのエラーモードを分析する。

提案手法

  • Brainfuck、Befunge-98、Whitespace、Unlambda、Shakespeareで実装されたEasy、Medium、Hard、Extra-Hardの80問題を用意するエソ Lang-ベンチを作成する。
  • Zero-Shot、Few-Shot、Self-Scaffolding、Textual Self-Scaffolding、ReActの5つのプロンプティング戦略の下で5つの最前線モデルを評価する。
  • インタプリタのフィードバックループを持つCodex、Claude Codeなどのエージェント系システムをOODタスクでテストし、ツール使用の影響を研究する。
  • 問題ごとに6つのテストケースとブートストラップ統計(3つの種、95%信頼区間)を用いた自動化されたインタプリタベース検証を使用する。
  • コンパイル、実行、論理のエラーをカテゴリ化して、コアのボトルネックを特定する。

実験結果

リサーチクエスチョン

  • RQ1LLMsは最小限の事前学習データ exposure でエソテリック言語への計算推論を転移できるか。
  • RQ2インコンテキスト学習と高度なプロンプティングはOODのエソテリック言語性能を改善するか、それとも事前学習のカバレージが制約要因か。
  • RQ3インタプリタとフィードバックループを持つエージェントシステムは、これらのOODタスクで非エージェント基準を上回るか。
  • RQ4エソテリック言語の問題を解くときの支配的なエラーモード(コンパイル、実行、論理)は何か、そしてそれらはモデルの限界を何に示しているか。

主な発見

  • フロンティアモデルには著しい能力ギャップがある:標準ベンチマークでの高性能がエソテリック言語タスクへは必ずしも منتقلされず(エソテリックタスクでの平均正答率0–11%)、という結果。
  • すべてのモデルは構成を問わずMedium、Hard、Extra-Hardのエソテリック問題で0%を示し、Easyレベルの問題のみ一部成功。
  • Self-scaffoldingは非エージェント系プロンプティングで最も良い成果を示し、言語/戦略の組み合わせによって最大約11.2%の正答率まで達するが、Pythonの性能には及ばない。
  • Few-shot promptingはこの極端にリソースが少ない設定でほとんど有効性を示さず、ICLの有効性は事前学習データのカバレッージに依存するという仮説を支持する。
  • インタプリタアクセスを持つエージェント系システムは非エージェント基準より2–3倍の改善をもたらすが、主流言語との同等性にはまだ達していない。
  • エラーログ分析では、多くの言語でコンパイルエラーが優勢で、意味的(論理)エラーは構文を習得した場所で多く見られ、WhitespaceやUnlambdaのようなデータが最も乏しい言語ではコンパイル失敗がほぼ全体を占める。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。