Skip to main content
QUICK REVIEW

[论文解读] Molecular machine learning with conformer ensembles

Simon Axelrod, Rafael Gómez‐Bombarelli|arXiv (Cornell University)|Dec 15, 2020
Computational Drug Discovery Methods被引用 9
一句话总结

本文提出了一种结合多种3D分子构象(4D表示)的深度学习模型,以提升药物发现中的分子性质预测。通过在ChemProp和SchNet等架构中引入构象注意力机制,该模型在性能上优于基于2D图的模型,但使用多个构象带来的性能提升有限——单个构象通常已足够,且注意力权重可揭示具有可解释性的结合相关构象。

ABSTRACT

Virtual screening can accelerate drug discovery by identifying promising candidates for experimental evaluation. Machine learning is a powerful method for screening, as it can learn complex structure-property relationships from experimental data and make rapid predictions over virtual libraries. Molecules inherently exist as a three-dimensional ensemble and their biological action typically occurs through supramolecular recognition. However, most deep learning approaches to molecular property prediction use a 2D graph representation as input, and in some cases a single 3D conformation. Here we investigate how the 3D information of multiple conformers, traditionally known as 4D information in the cheminformatics community, can improve molecular property prediction in deep learning models. We introduce multiple deep learning models that expand upon key architectures such as ChemProp and Schnet, adding elements such as multiple-conformer inputs and conformer attention. We then benchmark the performance trade-offs of these models on 2D, 3D and 4D representations in the prediction of drug activity using a large training set of geometrically resolved molecules. The new architectures perform significantly better than 2D models, but their performance is often just as strong with a single conformer as with many. We also find that 4D deep learning models learn interpretable attention weights for each conformer.

研究动机与目标

  • 探究在分子性质预测中引入多个3D分子构象(4D表示)是否能显著提升深度学习模型的性能。
  • 在包含几何解析分子的大规模数据集上,对2D、3D和4D模型在预测药物活性方面的性能进行基准测试。
  • 评估4D模型是否能学习到可解释的注意力权重,以突出显示生物相关的构象。
  • 评估从SARS-CoV到SARS-CoV-2的迁移学习在3D和4D模型中的实用性。
  • 通过引入ROCE(ROC在0.5%、1%、2%、5%处的增强)作为补充评估指标,解决标准指标在类别不平衡药物发现数据集中的局限性。

提出的方法

  • 提出基于ChemProp和SchNet的新深度学习架构,接受多个构象作为输入,利用构象注意力机制加权每个构象的贡献。
  • 在包含几何解析结构的大规模分子数据集上训练模型,采用平衡采样和多个随机种子以确保结果稳健性。
  • 采用标准机器学习指标(包括ROC-AUC、PRC-AUC和ROCE(ROC在0.5%、1%、2%、5%处的增强))评估模型性能。
  • 对2D模型采用集成不确定性量化,对3D/4D模型则通过在不同训练周期上的模型平均来估计不确定性。
  • 通过在SARS-CoV数据上进行预训练,随后在SARS-CoV-2抑制数据上微调,实现迁移学习。
  • 通过分子动力学或系统性搜索对构象进行采样,为每种分子生成多样化的3D表示。

实验结果

研究问题

  • RQ1与基于2D图的模型相比,引入多个3D构象(4D表示)是否能显著提升分子性质预测性能?
  • RQ2使用多个构象带来的性能提升是否显著,还是单个代表性构象已足够?
  • RQ34D深度学习模型能否学习到可解释的注意力权重,以突出显示生物相关的构象?
  • RQ4从SARS-CoV到SARS-CoV-2的迁移学习是否能提升预测性能,且这种提升是否依赖于使用3D或4D表示?
  • RQ5在类别不平衡的数据集中,标准评估指标(如ROC-AUC和PRC-AUC)与ROCE相比,哪一种更适用于评估虚拟筛选性能?

主要发现

  • 4D模型在预测SARS-CoV-2抑制活性方面显著优于2D图基模型,ROC-AUC和PRC-AUC得分更高。
  • 使用单个代表性3D构象的模型性能与使用多个构象的模型相当,表明完整4D输入带来的额外收益有限。
  • 4D模型中的构象注意力机制学习到了可解释的权重,突出了在结构上与结合相关的构象。
  • 从SARS-CoV到SARS-CoV-2的迁移学习提升了模型性能,但增益有限,且未明显偏向3D或4D模型优于2D模型。
  • ROCE评分(在0.5%、1%、2%和5%处评估)相较于仅使用ROC-AUC或PRC-AUC,能更准确地评估虚拟筛选性能,尤其在类别不平衡的数据集中。
  • 2D模型通过集成训练获得的不确定性估计更可靠,而3D/4D模型由于计算限制,需通过在不同训练周期上的平均来估计不确定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。