Skip to main content
QUICK REVIEW

[论文解读] SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models

Kehua Feng, Shen, Xinyi|arXiv (Cornell University)|Jun 13, 2024
Topic Modeling被引用 4
一句话总结

SciKnowEval 引入了一个全面的基准,用于评估大型语言模型(LLMs)在五个渐进式科学知识层级——广泛学习、认真探究、深刻思考、清晰辨别和勤勉实践——上的表现,采用生物学和化学领域的 50,048 个样本数据集。尽管性能处于最先进水平,即使是顶级模型如 GPT-4o 在科学推理、安全意识和实验方案生成方面仍存在显著差距,凸显其在实际科学研究应用中的关键局限性。

ABSTRACT

Large language models (LLMs) are playing an increasingly important role in scientific research, yet there remains a lack of comprehensive benchmarks to evaluate the breadth and depth of scientific knowledge embedded in these models. To address this gap, we introduce SciKnowEval, a large-scale dataset designed to systematically assess LLMs across five progressive levels of scientific understanding: memory, comprehension, reasoning, discernment, and application. SciKnowEval comprises 28K multi-level questions and solutions spanning biology, chemistry, physics, and materials science. Using this benchmark, we evaluate 20 leading open-source and proprietary LLMs. The results show that while proprietary models often achieve state-of-the-art performance, substantial challenges remain -- particularly in scientific reasoning and real-world application. We envision SciKnowEval as a standard benchmark for evaluating scientific capabilities in LLMs and as a catalyst for advancing more capable and reliable scientific language models.

研究动机与目标

  • 为解决当前缺乏全面、多层次基准来评估 LLM 中科学知识的不足。
  • 克服现有基准仅关注中学水平科学或缺乏伦理与安全评估的局限性。
  • 基于儒家哲学构建一个系统性框架,以模拟人类科学学习过程。
  • 在五个渐进层级上评估 LLM:知识获取、探究、推理、伦理辨别和实际应用。
  • 通过大规模、多样化且具备伦理意识的基准,推动更安全、更强大的科学 LLM 的发展。

提出的方法

  • 设计一个受《中庸》思想启发的五级科学知识评估框架,模拟从知识获取到实际应用的渐进过程。
  • 构建一个大规模、多源数据集,包含 50,048 个来自教科书、文献、数据库及自生成内容的科学问题与解答,涵盖生物学和化学领域。
  • 将任务划分为五个层级:广泛学习(知识回忆)、认真探究(探究能力)、深刻思考(推理能力)、清晰辨别(伦理/安全)、勤勉实践(实验设计)。
  • 采用零样本和少样本提示方法,对 20 个领先的开源与专有 LLM 在全部五个层级上进行评估。
  • 引入人工标注评分(例如,使用 GPT-4o 作为裁判),评估模型在复杂科学任务中的准确性、完整性和安全性。
  • 通过包含高危化学物质合成和法规合规等安全关键任务,确保伦理评估的完整性。

实验结果

研究问题

  • RQ1LLMs 在从基础记忆到复杂实验设计的多层级科学知识体系中表现如何,涵盖从基础到高级的科学认知?
  • RQ2专有 LLM 与开源 LLM 在科学推理、安全意识和科学知识实际应用方面存在多大程度的差异?
  • RQ3现有基准是否足以捕捉真实科研与实验所要求的科学理解深度?
  • RQ4LLMs 在高风险科学任务(如合成被禁化学品)中如何处理伦理与安全考量?
  • RQ5LLM 生成的科学实验方案中,关键失败点是什么,尤其是在试剂选择和步骤细节方面?

主要发现

  • 即使最先进的模型 GPT-4o,在最高层级(L5)的试剂与实验步骤生成任务中,平均得分仅为 3/5,表明其在实际科学专业能力方面存在显著差距。
  • 专有 LLM 尽管性能处于最先进水平,但在科学计算与应用方面仍表现出明显缺陷,尤其在处理安全关键任务时。
  • 没有任何模型完全掌握 L5 层级(勤勉实践),GPT-4o 在脂质组学固相萃取(SPE)方案设计任务中仅得 2/5 分,遗漏了关键试剂与剂量。
  • 该基准揭示当前 LLM 在实验设计中常缺乏具体性与完整性,尤其在正确命名溶剂、比例和内标物方面表现不足。
  • 伦理与安全考量在现有基准中一贯被忽视,但 SciKnowEval 明确纳入此类评估,暴露出当前 LLM 评估中的关键盲区。
  • 数据集与代码已公开发布于 https://github.com/hicai-zju/sciknoweval,支持科学 LLM 的可复现与标准化评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。