[论文解读] TheoremQA: A Theorem-driven Question Answering dataset
TheoremQA 引入了首个以定理为核心的问答数据集,包含 STEM 领域中 350 个定理的 800 个高质量问题,旨在评估大语言模型应用特定领域定理的能力。使用思维链(Program-of-Thoughts)提示时,GPT-4 的准确率为 51%,而开源模型的准确率均低于 15%,凸显了显著的性能差距,并凸显了开展定理感知预训练的必要性。
The recent LLMs like GPT-4 and PaLM-2 have made tremendous progress in solving fundamental math problems like GSM8K by achieving over 90% accuracy. However, their capabilities to solve more challenging math problems which require domain-specific knowledge (i.e. theorem) have yet to be investigated. In this paper, we introduce TheoremQA, the first theorem-driven question-answering dataset designed to evaluate AI models' capabilities to apply theorems to solve challenging science problems. TheoremQA is curated by domain experts containing 800 high-quality questions covering 350 theorems (e.g. Taylor's theorem, Lagrange's theorem, Huffman coding, Quantum Theorem, Elasticity Theorem, etc) from Math, Physics, EE&CS, and Finance. We evaluate a wide spectrum of 16 large language and code models with different prompting strategies like Chain-of-Thoughts and Program-of-Thoughts. We found that GPT-4's capabilities to solve these problems are unparalleled, achieving an accuracy of 51% with Program-of-Thoughts Prompting. All the existing open-sourced models are below 15%, barely surpassing the random-guess baseline. Given the diversity and broad coverage of TheoremQA, we believe it can be used as a better benchmark to evaluate LLMs' capabilities to solve challenging science problems. The data and code are released in https://github.com/wenhuchen/TheoremQA.
研究动机与目标
- 为解决缺乏评估大语言模型在需要特定领域知识的复杂、依赖定理的科学问题上的基准这一问题。
- 创建一个高质量、由专家精心整理的数据集,包含 800 个问题-定理-答案三元组,涵盖数学、物理、电气工程与计算机科学、以及金融领域。
- 使用思维链(Chain-of-Thoughts)和程序思维链(Program-of-Thoughts)提示方法,评估多种大语言模型和代码模型在基于定理的推理任务中的表现。
- 识别大语言模型输出中的失败模式和错误类型,特别是关于定理回忆、公式应用和计算错误方面。
- 探讨涉及图表的多模态科学问题所面临的挑战,并评估视觉增强型大语言模型的表现。
提出的方法
- 该数据集分两个阶段构建:首先,在 STEM 子领域中列举了 400 个定理;其次,由领域专家从教科书和互联网中搜集并优化了 800 个问题,以确保答案格式的一致性。
- 问题经过筛选,要求应用特定定理,如泰勒定理(Taylor’s theorem)、拉格朗日中值定理(Lagrange’s theorem)和量子定理(Quantum Theorem),以确保需要特定领域的推理。
- 评估了广泛范围的 16 种经过指令微调的语言和代码模型,包括 GPT-4、Claude、LLaMA、CodeGen 和 StarCoder。
- 应用了两种提示策略——思维链(Chain-of-Thoughts, CoT)和程序思维链(Program-of-Thoughts, PoT),以评估推理效率和准确性。
- 探索了定理注入技术,通过在输入提示中显式包含相关定理来提升模型性能。
- 通过将文本与图表配对,创建了多模态问题,并在有无视觉编码器(CLIP、BLIP)的情况下评估了模型表现。
实验结果
研究问题
- RQ1最先进的大语言模型在需要深度领域特定知识的定理驱动科学问题上表现如何?
- RQ2与思维链(Chain-of-Thoughts)相比,程序思维链(Program-of-Thoughts)提示是否能提升推理准确性和输出稳定性?
- RQ3大语言模型在解决基于定理的问题时的主要失败模式是什么?不同模型之间的失败模式有何差异?
- RQ4视觉编码器在涉及图表的多模态科学问题上能在多大程度上提升性能?
- RQ5开源大语言模型能否在基于定理的推理任务中达到具有竞争力的表现,还是必须在科学特定数据上进行微调?
主要发现
- 使用程序思维链提示时,GPT-4 在 TheoremQA 上达到了 51% 的准确率,显著优于所有其他模型。
- 第二名的模型是 ChatGPT,使用相同提示方法时准确率为 35%,表明其与 GPT-4 之间存在显著性能差距。
- GPT-4 的一半错误源于微小的计算或舍入错误,表明通过改进提示策略或人工干预,可显著缩小剩余的准确率差距。
- 所有测试的开源模型准确率均低于 15%,仅略高于随机猜测,表明迫切需要开展定理感知的预训练或微调。
- 视觉增强型大语言模型(如 LLaVA 和 VisualGLM)在性能上并未显著优于纯文本模型(如 Alpaca),表明当前视觉编码器在处理图表型科学问题方面仍显不足。
- 错误分析显示,Alpaca 的主要失败模式是不了解定理(E1),而 GPT-4 的错误主要为微小的计算错误(E3),表明不同模型的失败模式存在明显差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。