[论文解读] SciCode: A Research Coding Benchmark Curated by Scientists
SciCode 是一个由科学家精心整理的基准测试,包含 80 个跨多个自然科学领域的复杂科学编程问题,被分解为 338 个子问题,要求具备知识回忆、推理和代码综合能力。在最真实的评估设置中,即使表现最佳的模型 Claude3.5-Sonnet 也仅解决了 4.6% 的主问题,凸显了该基准测试的严格性以及当前大语言模型在科学代码生成方面的能力局限。
Since language models (LMs) now outperform average humans on many challenging tasks, it has become increasingly difficult to develop challenging, high-quality, and realistic evaluations. We address this issue by examining LMs' capabilities to generate code for solving real scientific research problems. Incorporating input from scientists and AI researchers in 16 diverse natural science sub-fields, including mathematics, physics, chemistry, biology, and materials science, we created a scientist-curated coding benchmark, SciCode. The problems in SciCode naturally factorize into multiple subproblems, each involving knowledge recall, reasoning, and code synthesis. In total, SciCode contains 338 subproblems decomposed from 80 challenging main problems. It offers optional descriptions specifying useful scientific background information and scientist-annotated gold-standard solutions and test cases for evaluation. Claude3.5-Sonnet, the best-performing model among those tested, can solve only 4.6% of the problems in the most realistic setting. We believe that SciCode demonstrates both contemporary LMs' progress towards becoming helpful scientific assistants and sheds light on the development and evaluation of scientific AI in the future.
研究动机与目标
- 为应对现有语言模型基准测试的饱和状态,创建一个高质量、贴近现实的科学代码生成评估套件。
- 开发一个反映真实科学研究任务的基准测试,确保其与自然科学领域实际应用的相关性。
- 通过从原始研究中整理问题并确保与现有公开数据集无重叠,克服数据污染和模型过拟合问题。
- 全面评估大语言模型在复杂、多步骤科学问题中的综合能力——包括知识回忆、推理与整合能力。
- 通过提供具有挑战性、结构清晰且完整标注与测试用例的基准测试,推动科学发现领域的人工智能新研究。
提出的方法
- 通过与领域科学家合作,从 16 个自然科学子领域(包括物理、化学、生物和材料科学)中精心整理出 80 个主科学问题。
- 将每个主问题分解为多个子问题,要求独立实现函数,以支持模块化评估与逐步推理。
- 为每个子问题提供详细的科学背景、标准答案解决方案以及多个测试用例,所有内容均由至少两名领域资深研究人员标注并验证。
- 设计多种评估设置,通过开关控制是否提供背景信息以及是否基于先前子问题的输出进行条件输入,以评估模型在不同现实程度下的鲁棒性。
- 通过排除与现有公开基准的重叠,并仅在必要时简化复杂问题以保持科学准确性,确保数据集的完整性。
- 在 https://scicode-bench.github.io/ 上部署排行榜并开源代码库,以支持可复现的评估与社区参与。

实验结果
研究问题
- RQ1最先进语言模型在真实科研中提取的复杂、多步骤问题上,能多大程度上生成正确且完整的科学代码?
- RQ2在解决特定领域编程任务时,科学背景知识的引入在多大程度上影响了模型的表现?
- RQ3在基于科学依据、强调推理能力的代码生成任务中,专有模型与开源模型的表现有何差异?
- RQ4模型架构与训练数据对模型泛化能力的影响如何,特别是在面对预训练阶段未见过的新科学问题时?
- RQ5一个具备高科学保真度且数据泄露极少的基准测试,能否作为评估人工智能在加速科学发现中作用的可靠代理?
主要发现
- 在最真实的评估设置中,表现最佳的模型 Claude3.5-Sonnet 仅解决了 4.6% 的主问题,表明仍有巨大提升空间。
- Claude3-Opus 和 GPT-4o 各自仅解决了 1.5% 的主问题,表明即使是顶级专有模型在复杂科学代码综合方面也面临显著挑战。
- 表现最佳的开源模型 Deepseek-Coder-v2 仅解决了 3.1% 的问题,凸显了封闭模型与开源模型在科学编程任务中的性能差距。
- 其他开源模型(包括 Llama-3-70B-Instruct 和 Mixtral-8x7b)解决的问题均不足 1%,突显了当前开源模型在科学推理与代码生成方面的局限性。
- 该基准测试的设计(包括科学背景信息与测试用例)显著提升了评估的可靠性,并支持对模型失败原因的细粒度分析。
- 问题的高难度——源于真实科研且需要深入的领域知识——证实 SciCode 是一个具有挑战性且贴近现实的科学人工智能评估基准。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。