[论文解读] Have LLMs Advanced Enough? A Challenging Problem Solving Benchmark For Large Language Models
本论文提出了 JEEBench,一个包含 515 道来自印度理工学院联合入学考试(IIT JEE-Advanced)的预工程物理、化学和数学问题的挑战性基准,旨在测试长时程推理与深层领域知识。尽管采用了链式思维(chain-of-thought)和自一致性(self-consistency)等先进提示技术,GPT-4 在 2023 年测试集上的得分仅为 33.8%,仅在应用事后置信度阈值筛选后,性能才提升至人类得分前 10–20% 的水平,暴露出在代数运算、概念检索和风险评估方面存在关键缺陷。
The performance of large language models (LLMs) on existing reasoning benchmarks has significantly improved over the past years. In response, we present JEEBench, a considerably more challenging benchmark dataset for evaluating the problem solving abilities of LLMs. We curate 515 challenging pre-engineering mathematics, physics and chemistry problems from the highly competitive IIT JEE-Advanced exam. Long-horizon reasoning on top of deep in-domain knowledge is essential for solving problems in this benchmark. Our evaluation on various open-source and proprietary models reveals that the highest performance, even after using techniques like self-consistency, self-refinement and chain-of-thought prompting, is less than 40%. The typical failure modes of GPT-4, the best model, are errors in algebraic manipulation, difficulty in grounding abstract concepts into mathematical equations accurately and failure in retrieving relevant domain-specific concepts. We also observe that by mere prompting, GPT-4 is unable to assess risk introduced by negative marking for incorrect answers. For this, we develop a post-hoc confidence-thresholding method over self-consistency, which enables effective response selection. We hope that our challenging benchmark will guide future re-search in problem-solving using LLMs.
研究动机与目标
- 开发一个严格的基准,用于评估大语言模型(LLMs)在现有推理数据集之外的问题解决能力。
- 评估当前 LLM,特别是 GPT-4,在解决高难度、多步骤问题方面的能力极限,这些问题需要深厚的 STEM 领域特定知识和长时程推理能力。
- 研究 LLM 推理中的失败模式,特别是在代数运算、概念检索和负分制度下的风险感知决策方面。
- 提出并评估一种事后置信度阈值筛选方法,利用自一致性输出改进响应选择。
- 提供一个可靠且受污染控制的数据集,以指导未来具备推理能力的 LLM 研究。
提出的方法
- 从 8 届 IIT JEE-Advanced 考试中精心筛选出 515 道具有挑战性的问题,重点涵盖需要多步推理和领域特定知识的物理、化学和数学问题。
- 应用链式思维(CoT)提示和自一致性(SC)技术,为每个问题生成多个推理路径,以提升鲁棒性。
- 在自一致性输出上实施一种事后置信度阈值筛选方法,使用预测答案的相对频率作为置信度的代理指标。
- 在该基准上对开源和专有 LLM 进行了广泛的定性和定量分析,包括 GPT-4。
- 通过在公开语料库中搜索问题实例,并评估模型在 2023 年问题上的表现,开展了污染程度研究,确认 2023 年的问题未被污染。
- 通过投影人类表现来标准化得分,并将 LLM 表现与 2023 年考试中的人类基准进行比较。
实验结果
研究问题
- RQ1当前 LLM,包括 GPT-4,能否可靠地解决需要深度领域知识和长时程推理的高难度、多步骤 STEM 问题?
- RQ2当前最先进 LLM 在复杂问题解决中的主要失败模式是什么,特别是在代数运算和概念检索方面?
- RQ3自一致性与自精炼技术在该基准上的推理性能提升效果如何?
- RQ4一种简单的事后置信度阈值筛选方法是否能改善 LLM 在具有负分制度的考试环境下的表现?
- RQ5JEEBench 数据集在多大程度上因预训练数据中的暴露而受到污染?这是否影响了模型性能评估?
主要发现
- GPT-4 在使用链式思维和自一致性提示的情况下,在 2023 年 IIT JEE-Advanced 测试集上得分为 33.8%,表明其推理鲁棒性有限。
- 在对自一致性输出应用置信度阈值筛选后,GPT-4 在 2023 年考试中的表现提升至人类得分前 10–20% 的水平。
- 所有评估模型中,即使使用了先进提示技术,最高得分仍低于 40%,凸显了 LLM 推理能力的持续挑战。
- 尽管在某些情况下逻辑推理能力较强,GPT-4 在代数运算和概念检索方面频繁失败。
- 该模型难以在考试环境中考虑负分制度,当被提示包含评分规则时,其表现下降。
- 数据集的污染程度估计仅为 6%,表明 GPT-4 的表现真实反映了其推理能力,而非记忆效应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。