Skip to main content
QUICK REVIEW

[论文解读] Learning Over Molecular Conformer Ensembles: Datasets and Benchmarks

Yanqiao Zhu, JeeHyun Hwang|arXiv (Cornell University)|Sep 29, 2023
Machine Learning in Materials Science被引用 6
一句话总结

该论文提出了 MARCEL,这是首个针对分子构象集合学习的综合性基准,包含四个涵盖分子与反应的多样化数据集,其属性通过DFT计算得到玻尔兹曼平均。结果表明,显式建模构象集合可显著提升1D、2D和3D分子表征学习模型的性能,尤其在涉及构象灵活性的任务中,如催化剂设计和反应选择性预测。

ABSTRACT

Molecular Representation Learning (MRL) has proven impactful in numerous biochemical applications such as drug discovery and enzyme design. While Graph Neural Networks (GNNs) are effective at learning molecular representations from a 2D molecular graph or a single 3D structure, existing works often overlook the flexible nature of molecules, which continuously interconvert across conformations via chemical bond rotations and minor vibrational perturbations. To better account for molecular flexibility, some recent works formulate MRL as an ensemble learning problem, focusing on explicitly learning from a set of conformer structures. However, most of these studies have limited datasets, tasks, and models. In this work, we introduce the first MoleculAR Conformer Ensemble Learning (MARCEL) benchmark to thoroughly evaluate the potential of learning on conformer ensembles and suggest promising research directions. MARCEL includes four datasets covering diverse molecule- and reaction-level properties of chemically diverse molecules including organocatalysts and transition-metal catalysts, extending beyond the scope of common GNN benchmarks that are confined to drug-like molecules. In addition, we conduct a comprehensive empirical study, which benchmarks representative 1D, 2D, and 3D molecular representation learning models, along with two strategies that explicitly incorporate conformer ensembles into 3D MRL models. Our findings reveal that direct learning from an accessible conformer space can improve performance on a variety of tasks and models.

研究动机与目标

  • 为解决现有分子表征学习(MRL)模型将分子视为静态结构的局限性,忽略其动态的构象灵活性。
  • 评估显式建模构象集合是否能在分子与反应性质预测中超越单构象或基于2D图的方法,从而提升性能。
  • 建立一个标准化基准,包含覆盖有机催化剂、过渡金属配合物及反应对映选择性的多样化、高质量数据集。
  • 研究在训练于构象集合与单个构象时,1D、2D和3D模型的相对优势。
  • 探索两种将集合信息整合到3D MRL模型中的策略:集合平均与基于注意力的聚合。

提出的方法

  • 作者构建了四个数据集——Drugs-75K、Kraken、EE 和 BDE,每个数据集均包含DFT优化的构象集合及玻尔兹曼平均的目标属性。
  • 每个数据集覆盖不同的化学空间:药物样分子(Drugs-75K)、有机磷配体(Kraken)、Rh-催化对映选择性反应(EE)以及Pd-催化氧化加成反应(BDE)。
  • 该基准评估1D(如基于SMILES)、2D(基于图)和3D(几何)模型,从分子图、单个构象或完整集合中预测集合平均属性。
  • 提出两种集合感知策略:(1) 对不同构象的预测结果进行平均;(2) 使用注意力机制根据构象对目标属性的贡献程度进行加权。
  • 所有模型均采用标准MRL协议进行训练与评估,性能通过RMSE和R²等回归指标在测试集上衡量。
  • 研究包含消融分析,以隔离模型架构差异对集合建模影响的独立效应。

实验结果

研究问题

  • RQ12D图神经网络在未提供显式集合输入的情况下,能在多大程度上隐式建模分子的构象灵活性?
  • RQ2显式建模一组构象是否能提升对电子亲和能或结合能等构象敏感性质的预测准确性?
  • RQ3当模型可访问构象集合或单个构象时,不同模型架构(1D、2D、3D)的表现如何?
  • RQ4在多种分子任务中,哪种集合整合策略——平均法或基于注意力的加权法——能实现更好的泛化性能?
  • RQ5当推理阶段缺乏DFT优化的构象集合时,基于集合的MRL模型是否仍能泛化到未见的构象分布?

主要发现

  • 显式建模构象集合在所有模型类型中均带来一致的性能提升,其中3D模型在构象敏感任务中表现出最大的相对改进。
  • 基于注意力的集合聚合策略优于简单平均法,尤其在构象方差较大的任务中,如EE数据集中对对映选择性的预测。
  • 2D GNN在未提供显式集合输入时,对构象效应的隐式建模能力有限,仅在获得显式集合输入时才观察到性能提升。
  • 在BDE数据集中,当推理阶段缺乏DFT优化的构象时,使用Open Babel生成的构象训练的模型仍表现出较强性能,表明对不完美构象集合具有鲁棒性。
  • MARCEL基准揭示了标准MRL基准在评估构象柔性体系模型时的不足,凸显了对集合感知评估的需求。
  • 研究表明,玻尔兹曼平均属性比单构象预测更具预测性,尤其在催化和电子性质方面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。