Skip to main content
QUICK REVIEW

[论文解读] Advanced Graph and Sequence Neural Networks for Molecular Property Prediction and Drug Discovery

Zhengyang Wang, Meng Liu|arXiv (Cornell University)|Dec 2, 2020
Computational Drug Discovery Methods被引用 4
一句话总结

该论文提出AdvProp,一种用于分子性质预测与药物发现的综合性机器学习框架,结合了先进的图神经网络与序列神经网络。该框架提出了一种多层级消息传递神经网络(ML-MPNN)用于基于图的学习,以及一种带有掩码嵌入恢复机制的对比-BERT模型用于序列建模,并通过新型AUC优化损失函数进行优化,在性能上达到最先进水平,包括在AI Cures开放挑战赛中于COVID-19药物发现任务上取得ROC-AUC与PRC-AUC的#1排名。

ABSTRACT

Properties of molecules are indicative of their functions and thus are useful in many applications. With the advances of deep learning methods, computational approaches for predicting molecular properties are gaining increasing momentum. However, there lacks customized and advanced methods and comprehensive tools for this task currently. Here we develop a suite of comprehensive machine learning methods and tools spanning different computational models, molecular representations, and loss functions for molecular property prediction and drug discovery. Specifically, we represent molecules as both graphs and sequences. Built on these representations, we develop novel deep models for learning from molecular graphs and sequences. In order to learn effectively from highly imbalanced datasets, we develop advanced loss functions that optimize areas under precision-recall curves. Altogether, our work not only serves as a comprehensive tool, but also contributes towards developing novel and advanced graph and sequence learning methodologies. Results on both online and offline antibiotics discovery and molecular property prediction tasks show that our methods achieve consistent improvements over prior methods. In particular, our methods achieve #1 ranking in terms of both ROC-AUC and PRC-AUC on the AI Cures Open Challenge for drug discovery related to COVID-19. Our software is released as part of the MoleculeX library under AdvProp.

研究动机与目标

  • 开发一个统一且全面的分子性质预测框架,整合图与序列表征。
  • 通过新型AUC优化损失函数,解决分子性质预测中高度不平衡数据集的挑战。
  • 通过在大规模未标注分子序列上进行自监督预训练,提升模型泛化能力与性能。
  • 在真实世界约束条件下,建立分子性质预测的新SOTA结果,特别是在药物发现任务中。
  • 在MoleculeX库中发布公开可用、模块化的工具集(AdvProp),以支持可复现且可扩展的研究。

提出的方法

  • 提出一种多层级消息传递神经网络(ML-MPNN),通过聚合节点、边、子图及整个分子图的信息,捕捉分层结构依赖关系。
  • 引入对比-BERT,一种基于序列的模型,利用掩码嵌入恢复任务与对比学习,在大规模未标注SMILES序列上进行预训练。
  • 采用代理损失函数以优化精确率-召回率曲线下方面积(PRC-AUC),包括基于平均精度(AP)的代理损失与基于边距的排序机制,以提升模型在不平衡数据上的鲁棒性。
  • 通过SOAP-ADAM与PESG进行随机优化,直接优化AUC指标,替代标准交叉熵损失,以更好地与评估标准对齐。
  • 在序列模型中应用基于掩码标记预测与上下文嵌入之间余弦相似度的对比损失函数,以增强表示学习能力。
  • 通过两层MLP将全局分子特征(200D,通过RDKit提取)与图级表征进行融合,用于最终预测。

实验结果

研究问题

  • RQ1一个整合图与序列深度学习模型的统一框架,是否能超越现有最先进方法,在分子性质预测中实现性能提升?
  • RQ2与标准交叉熵损失相比,新型AUC优化损失函数在处理高度不平衡分子性质数据集方面效果如何?
  • RQ3通过掩码嵌入恢复实现的自监督预训练,在多大程度上能提升下游分子性质预测性能?
  • RQ4图神经网络中的多层级消息传递是否能捕捉比标准消息传递更丰富的结构信息,从而带来性能提升?
  • RQ5图与序列建模的结合是否能提供互补信号,从而在多种多样的分子预测任务中带来一致的性能增益?

主要发现

  • AdvProp在AI Cures开放挑战赛的COVID-19药物发现任务中,于ROC-AUC与PRC-AUC两项指标上均取得#1排名,优于所有其他提交方法。
  • 所提出的ML-MPNN模型在分子性质预测基准测试中表现达到最先进水平,尤其在捕捉多图层级间复杂结构依赖关系方面表现出色。
  • 带有掩码嵌入恢复机制的对比-BERT模型在下游任务中表现强劲,证明了在大规模未标注SMILES数据上进行自监督预训练的有效性。
  • AUC优化损失函数,尤其是基于AP的代理损失,显著提升了模型在不平衡数据集上的性能,尤其在精确率-召回率空间中表现突出。
  • 将全局分子特征与图级表征融合,显著提升了多个数据集与任务中的性能,且结果一致。
  • 通过MoleculeX库开源发布AdvProp,使得所提出模型与工具可在药物发现研究中实现可复现与可扩展的应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。