[论文解读] M$^2$Hub: Unlocking the Potential of Machine Learning for Materials Discovery
M²Hub 是一个全面的机器学习工具包,旨在通过整合虚拟筛选、逆向设计和分子模拟中的数据集、任务、模型和基准,加速材料发现。它提供 11 个数据集,涵盖 6 种材料类型和 56 项任务,采用真实的数据划分,支持对最先进模型(包括非周期性结构的模型)在性质预测和生成式设计任务上的基准测试,配套开源代码和透明的评估协议。
We introduce M$^2$Hub, a toolkit for advancing machine learning in materials discovery. Machine learning has achieved remarkable progress in modeling molecular structures, especially biomolecules for drug discovery. However, the development of machine learning approaches for modeling materials structures lag behind, which is partly due to the lack of an integrated platform that enables access to diverse tasks for materials discovery. To bridge this gap, M$^2$Hub will enable easy access to materials discovery tasks, datasets, machine learning methods, evaluations, and benchmark results that cover the entire workflow. Specifically, the first release of M$^2$Hub focuses on three key stages in materials discovery: virtual screening, inverse design, and molecular simulation, including 9 datasets that covers 6 types of materials with 56 tasks across 8 types of material properties. We further provide 2 synthetic datasets for the purpose of generative tasks on materials. In addition to random data splits, we also provide 3 additional data partitions to reflect the real-world materials discovery scenarios. State-of-the-art machine learning methods (including those are suitable for materials structures but never compared in the literature) are benchmarked on representative tasks. Our codes and library are publicly available at https://github.com/yuanqidu/M2Hub.
研究动机与目标
- 弥合材料发现领域机器学习基础设施与分子及生物分子应用之间的差距。
- 提供一个集中化、集成化的平台,支持材料科学中机器学习工作流的完整环节:数据、任务、模型、评估和基准测试。
- 通过多种数据划分(包括分布外场景)实现真实评估,以提高模型的鲁棒性。
- 通过提供合成数据集、评估指标和虚拟函数,支持生成式材料设计。
- 在代表性任务上对多样化的机器学习模型(包括此前在材料领域未比较过的模型)进行基准测试。
提出的方法
- 整理 11 个数据集,涵盖 6 种材料类型(如晶体、二维材料、金属有机框架)以及 8 种材料性质的 56 项任务。
- 设计三种超越随机划分的数据划分方式,以反映材料发现中真实世界的分布外场景。
- 集成 13 种代表性机器学习模型,包括图神经网络(CGCNN、MEGNet、SchNet、DimeNet++、GemNet、Equiformer、LEFTNet)和基于成分的模型(ALIGNN),用于性质预测和生成任务。
- 实施标准化的数据处理流程和评估协议,包括用于回归任务的 MAE、RMSE 和 R² 等指标。
- 提供虚拟函数和评估框架,用于逆向设计和生成式材料建模。
- 将所有代码、数据集和基准结果托管在公共 GitHub 仓库中,以确保可复现性和社区使用。
实验结果
研究问题
- RQ1统一平台在多大程度上能提升材料发现中机器学习模型的可复现性和基准测试能力?
- RQ2最先进模型在多样化材料和性质预测任务(包括非周期性结构)中的性能差异如何,特别是在不同材料类型和性质上的表现?
- RQ3真实数据划分(如分布外场景)如何影响模型的泛化能力和评估可靠性?
- RQ4现有机器学习模型在多大程度上能有效应用于生成式材料设计任务?
- RQ5模型架构、训练方案和目标函数在解决特定材料发现问题时分别起到什么作用?
主要发现
- M²Hub 提供 11 个精心整理的数据集,涵盖 8 种材料性质的 56 项任务,其中包括 2 个用于生成建模的合成数据集。
- 该基准包含三种超越随机划分的真实数据划分,增强了模型在分布外设置下的评估鲁棒性。
- 在测试的模型中,DimeNet++ 和 GemNet 在 qmof 带隙任务上的平均排名最佳(分别为 2.4 和 2.9),而 ALIGNN 在基于成分的任务中表现优异,平均排名为 2.3。
- 训练效率存在显著差异:CGCNN 和 SchNet 更快(例如,在 V100 上 pdos 任务耗时 68 秒),而 Equiformer 和 LEFTNet 更慢(例如,pdos 任务耗时 713 秒和 117 秒),表明准确率与推理速度之间存在权衡。
- EGNN 和 DimeNet++ 等模型在多项任务中表现强劲,其中 EGNN 在 100 个原子以下系统上的 e_form 任务中实现了最低的 MAE(0.0113)。
- 基准测试表明,模型选择对性能影响显著,ALIGNN 和 SchNet 在多种材料和性质类型中均表现出强大的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。