Skip to main content
QUICK REVIEW

[论文解读] EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages

Aman Sharma, Paras Chopra|arXiv (Cornell University)|Mar 10, 2026
Machine Learning in Materials Science被引用 0
一句话总结

EsoLang-Bench 引入一种五语言的晦涩基准,用于测试大语言模型的真正推理能力,显示标准基准表现与分布外的晦涩任务之间存在巨大差距,即使在使用高级提示和代理系统的情况下也是如此。

ABSTRACT

Large language models achieve near-ceiling performance on code generation benchmarks, yet these results increasingly reflect memorization rather than genuine reasoning. We introduce EsoLang-Bench, a benchmark using five esoteric programming languages (Brainfuck, Befunge-98, Whitespace, Unlambda, and Shakespeare) that lack benchmark gaming incentives due to their economic irrationality for pre-training. These languages require the same computational primitives as mainstream programming but have 1,000-100,000x fewer public repositories than Python (based on GitHub search counts). We evaluate five frontier models across five prompting strategies and find a dramatic capability gap: models achieving 85-95% on standard benchmarks score only 0-11% on equivalent esoteric tasks, with 0% accuracy beyond the Easy tier. Few-shot learning and self-reflection fail to improve performance, suggesting these techniques exploit training priors rather than enabling genuine learning. EsoLang-Bench provides the first benchmark designed to mimic human learning by acquiring new languages through documentation, interpreter feedback, and iterative experimentation, measuring transferable reasoning skills resistant to data contamination.

研究动机与目标

  • 通过使用最少预训练数据的语言来避免基准测试玩游戏,促进对真正推理的评估。
  • 提供在五种晦涩语言中实现的80道难度等级分布在四个等级的问题数据集。
  • 评估提示策略和代理系统使用对分布外(OOD)推理性能的影响。
  • 分析错误模式(编译、运行时、逻辑)以理解当前前沿模型的根本局限性。

提出的方法

  • 在 Brainfuck、Befunge-98、Whitespace、Unlambda、Shakespeare 中实现 Easy、Medium、Hard、Extra-Hard 四个难度等级的 80 道题,组成为 EsoLang-Bench。
  • 在五种前沿模型上评估五种提示策略(Zero-Shot、Few-Shot、Self-Scaffolding、Textual Self-Scaffolding、ReAct)。
  • 测试具备解释器反馈回路的代理系统(Codex、Claude Code),研究工具使用对OOD任务的影响。
  • 使用自动化解释器验证,每题6个测试用例并采用自举统计(三组种子;95% 置信区间)。
  • 通过将编译、运行时和逻辑失败分类来分析错误,以识别核心瓶颈。

实验结果

研究问题

  • RQ1LLMs 是否能在最少预训练数据暴露下,将计算推理迁移到晦涩语言?
  • RQ2上下文学习和高级提示是否提升OOD晦涩语言的表现,还是预训练覆盖率才是限制因素?
  • RQ3具备解释器与反馈回路的代理系统是否在这些OOD任务上优于非代理基线?
  • RQ4解决晦涩语言问题时,最主要的错误模式(编译、运行时、逻辑)是什么,它们揭示了模型的哪些局限?

主要发现

  • 前沿模型存在显著能力差距:在标准基准上表现良好并不转化为晦涩语言任务的能力(晦涩任务平均准确率为0–11%)。
  • 所有模型在 Medium、Hard、和 Extra-Hard 的晦涩问题在所有配置上均为0%;只有 Easy 级别的问题取得了一定成功。
  • Self-scaffolding 在非代理性提示中效果最佳,在某些语言/策略组合中准确率最高可达约11.2%,但仍远低于 Python 的表现。
  • Few-shot 提示在这个极低资源场景中几乎没有提升,支持这样一个假设:ICL 效果依赖于预训练数据覆盖。
  • 具备解释器访问的代理系统较非代理基线提升约2–3倍,但仍远未达到主流语言的水平。
  • 错误分析显示在许多语言中编译错误占主导,语义(逻辑)错误在获得语法后变得普遍,在像 Whitespace 与 Unlambda 这样数据极少的语言中几乎完全为编译失败。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。