[论文解读] JARVIS-Leaderboard: A Large Scale Benchmark of Materials Design Methods
JARVIS-Leaderboard 是一个开源、社区驱动的基准平台,整合了多种材料设计方法——人工智能、电子结构、力场、量子计算和实验——涵盖多种数据模态,包括理想和缺陷材料。该平台支持可复现、透明且标准化的方法评估,目前已收录超过1,200项贡献,并基于 JARVIS-DFT 3D 数据集(5,572 种材料)使用 MAE 和 MAD/MAE 比值等指标进行全面的性能对比。
Lack of rigorous reproducibility and validation are major hurdles for scientific development across many fields. Materials science in particular encompasses a variety of experimental and theoretical approaches that require careful benchmarking. Leaderboard efforts have been developed previously to mitigate these issues. However, a comprehensive comparison and benchmarking on an integrated platform with multiple data modalities with both perfect and defect materials data is still lacking. This work introduces JARVIS-Leaderboard, an open-source and community-driven platform that facilitates benchmarking and enhances reproducibility. The platform allows users to set up benchmarks with custom tasks and enables contributions in the form of dataset, code, and meta-data submissions. We cover the following materials design categories: Artificial Intelligence (AI), Electronic Structure (ES), Force-fields (FF), Quantum Computation (QC) and Experiments (EXP). For AI, we cover several types of input data, including atomic structures, atomistic images, spectra, and text. For ES, we consider multiple ES approaches, software packages, pseudopotentials, materials, and properties, comparing results to experiment. For FF, we compare multiple approaches for material property predictions. For QC, we benchmark Hamiltonian simulations using various quantum algorithms and circuits. Finally, for experiments, we use the inter-laboratory approach to establish benchmarks. There are 1281 contributions to 274 benchmarks using 152 methods with more than 8 million data-points, and the leaderboard is continuously expanding. The JARVIS-Leaderboard is available at the website: https://pages.nist.gov/jarvis_leaderboard
研究动机与目标
- 通过建立统一的基准测试基础设施,解决材料科学中可复现性和验证性不足的关键问题。
- 将多种材料设计方法——包括人工智能、电子结构、力场、量子计算和实验数据——整合到一个可扩展的统一平台中。
- 支持社区对数据集、代码和元数据的贡献,以增强透明度、可复现性和方法验证。
- 提供标准化的评估指标和比较工具(例如 Jupyter 笔记本),以实现方法间的一致性性能评估。
- 支持理想和缺陷材料的数据,以反映现实世界的复杂性并提升方法的鲁棒性。
提出的方法
- 在 NIST 的 JARVIS 基础设施上建立一个集中化、开放获取的平台,托管涵盖五个领域(人工智能、电子结构、力场、量子计算、实验)的基准任务。
- 采用标准化评估协议,使用均方误差(MAE)和均绝对偏差与 MAE 的比值(MAD/MAE)等指标,实现跨方法的比较。
- 整合多种数据模态,包括原子结构、原子图像、光谱、文本以及来自多实验室协同测试实验的实验结果。
- 在人工智能基准中支持多种输入类型,包括 Magpie 和 Voronoi 拆分描述符,并与神经网络模型进行比较。
- 通过 Jupyter 和 Google Colab 笔记本实现可复现性,用于可视化和分析基准结果的性能。
- 通过结构化的提交流程支持贡献,包括数据集、代码和元数据,确保版本控制和来源追踪。

实验结果
研究问题
- RQ1不同人工智能模型(如基于描述符的模型与神经网络)在预测材料性质(如形成能)方面,对不同数据输入的性能表现如何?
- RQ2电子结构方法在不同软件包、赝势和材料之间,相对于实验数据的预测一致性与准确性如何?
- RQ3力场模型在预测多种材料的体积累 modulus 及其他力学性能方面表现如何?
- RQ4不同量子线路和算法在使用哈密顿量模拟方法模拟电子能带结构方面的性能表现如何?
- RQ5在多个实验室中,复杂性质(如沸石中的 CO2 吸附)的实验结果可复现性如何?
主要发现
- 在人工智能回归任务中,性能最佳的基于描述符的模型是使用 Magpie 和 Voronoi 拆分特征的树模型,其在所有测试基准中均优于神经网络。
- 在 JARVIS-DFT 3D 数据集(5,572 种材料)中,人工智能基准表现出一致的性能,MAE 值能够清晰地对不同输入模态的方法进行排序。
- 电子结构基准揭示了不同软件包和赝势在带隙预测方面存在显著差异,某些情况下与实验值的偏差高达数 eV。
- 量子计算基准表明,不同量子线路和算法在模拟铝的电子能带结构时表现出不同的准确性,性能取决于线路深度和量子比特映射方式。
- 针对 ZSM-5 沸石中 CO2 吸附的多实验室实验比较显示,各实验室间存在可测量的差异,凸显了制定标准化协议的必要性。
- MAD/MAE 比值作为性能比较的稳健指标,其数值表明部分模型在高维或噪声较大的数据环境中表现出相对于其平均误差更高的方差。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。