[论文解读] SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
SciEval 是一个全面的、多层级的基准,用于评估大语言模型(LLMs)在科学推理方面的能力,涵盖化学、物理和生物领域的客观题与主观题。它通过基于科学原理的动态数据生成来防止数据泄露,并从四个维度——基础知识、知识应用、科学计算和研究能力——评估 LLMs,结果表明 GPT-4 表现领先,但在动态和实验推理任务中仍存在显著差距。
Recently, there has been growing interest in using Large Language Models (LLMs) for scientific research. Numerous benchmarks have been proposed to evaluate the ability of LLMs for scientific research. However, current benchmarks are mostly based on pre-collected objective questions. This design suffers from data leakage problem and lacks the evaluation of subjective Q/A ability. In this paper, we propose SciEval, a comprehensive and multi-disciplinary evaluation benchmark to address these issues. Based on Bloom's taxonomy, SciEval covers four dimensions to systematically evaluate scientific research ability. In particular, we design a "dynamic" subset based on scientific principles to prevent evaluation from potential data leakage. Both objective and subjective questions are included in SciEval. These characteristics make SciEval a more effective benchmark for scientific research ability evaluation of LLMs. Comprehensive experiments on most advanced LLMs show that, although GPT-4 achieves SOTA performance compared to other LLMs, there is still substantial room for improvement, especially for dynamic questions. The codes and data are publicly available on https://github.com/OpenDFM/SciEval.
研究动机与目标
- 解决现有基准仅依赖静态客观问题且存在数据泄露问题的局限性。
- 开发一个全面的评估框架,以捕捉 LLMs 在科学推理能力方面的完整谱系。
- 结合客观题与主观题,包括实验设计和结果分析,以评估更高阶的科学思维。
- 通过基于科学原理的动态数据生成,减轻数据泄露风险。
- 提供一个标准化的、跨学科的基准,用于评估最先进 LLMs 在真实世界科学研究场景中的表现。
提出的方法
- SciEval 以布卢姆分类学为基础,从四个认知维度评估 LLMs:基础知识、知识应用、科学计算和研究能力。
- 该基准涵盖化学、物理和生物领域的 15,901 道题目,包括动态和静态子集在内共计 18,000 道题目。
- 通过实时运用科学原理生成动态数据,防止记忆化,确保评估的公平性。
- 数据集包含一个专门的“实验数据”子集,包含 12 项真实的科学实验,涉及实验设计和结果解释的主观推理。
- 评估在三种设置下进行:仅答案、思维链(CoT)和 few-shot(3-shot),以支持不同推理策略的性能比较。
- 性能通过准确率、BLEU 分数和均方误差(用于计算任务)进行衡量,并按领域和设置进行结果分析。

实验结果
研究问题
- RQ1最先进 LLMs 在包含客观题与主观题的多层级、跨学科科学基准上的表现如何?
- RQ2当在静态、预先收集的科学问题上评估时,LLMs 在多大程度上表现出数据泄露?
- RQ3不同的推理策略——仅答案、思维链和 few-shot——如何影响 LLMs 在科学推理任务上的表现?
- RQ4LLMs 在动态、基于原理的科学问题上的泛化能力如何,这些问题可防止记忆化?
- RQ5LLMs 在科学计算和实验结果分析方面存在哪些具体缺陷,特别是在物理和化学领域?
主要发现
- GPT-4 在所有子集上均达到最先进性能,平均准确率和 BLEU 分数最高,尤其在 3-shot 设置下,其在动态数据上的准确率达到 51.01%。
- 尽管表现优异,GPT-4 在 CoT 设置下处理物理问题时常使用错误公式,表明其尽管准确率高,仍存在推理缺陷。
- 大多数 LLMs,包括 GPT-3.5-turbo 和 Claude-v1.3,在静态数据上的准确率低于 60%,表明仍有巨大提升空间。
- 在物理子集中,所有模型在动态数据上的表现接近随机,多数准确率低于 25%,表明其在新物理问题上的泛化能力极差。
- 像 Galactica-30B 这类模型在科学计算任务中表现优于其他模型,尤其在化学领域,表明领域特定预训练具有优势。
- 所有模型在实验数据子集的实验结果分析方面均表现显著困难,尽管其在实验设计和原理理解方面表现尚可。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。