Skip to main content
QUICK REVIEW

[论文解读] MolE: a molecular foundation model for drug discovery

Oscar Méndez‐Lucio, Christos A. Nicolaou|arXiv (Cornell University)|Nov 3, 2022
Computational Drug Discovery Methods被引用 8
一句话总结

MolE 是一种分子基础模型,利用基于 DeBERTa 的 Transformer 架构,直接从分子图中学习分子表征,使用原子环境作为标记。通过在化学结构上进行自监督预训练,并在生物性质上进行多任务监督预训练,MolE 在 Therapeutic Data Commons 基准的 22 项 ADMET 任务中取得了 9 项的最先进性能。

ABSTRACT

Models that accurately predict properties based on chemical structure are valuable tools in drug discovery. However, for many properties, public and private training sets are typically small, and it is difficult for the models to generalize well outside of the training data. Recently, large language models have addressed this problem by using self-supervised pretraining on large unlabeled datasets, followed by fine-tuning on smaller, labeled datasets. In this paper, we report MolE, a molecular foundation model that adapts the DeBERTa architecture to be used on molecular graphs together with a two-step pretraining strategy. The first step of pretraining is a self-supervised approach focused on learning chemical structures, and the second step is a massive multi-task approach to learn biological information. We show that fine-tuning pretrained MolE achieves state-of-the-art results on 9 of the 22 ADMET tasks included in the Therapeutic Data Commons.

研究动机与目标

  • 为解决分子性质预测中标签数据有限的挑战,开发一种在大规模未标注分子数据上预训练的基础模型。
  • 通过从化学结构和生物性质中学习稳健的分子表征,提升药物发现中的泛化能力。
  • 将自然语言处理技术——特别是 DeBERTa 等 Transformer 架构——应用于分子图,使用原子环境作为标记。
  • 评估两阶段预训练策略的有效性:先在分子结构上进行自监督学习,再在生物性质上进行多任务学习。
  • 证明基于原子环境的表征优于传统指纹方法,并在小规模标签数据集上实现更优的微调性能。

提出的方法

  • MolE 使用原子环境(定义为一个中心原子及其邻近原子)作为标记,使模型能够将分子图作为序列输入进行处理。
  • 模型采用 DeBERTa 中的解耦注意力机制,以建模分子图中原子之间的相对位置关系。
  • 自监督预训练通过从低半径(如半径 0)原子环境预测高半径(如半径 2)原子环境来实现,学习内在的化学拓扑结构。
  • 随后进行监督的多任务预训练,使用广泛的生物和理化性质,使分子表征与功能相关性对齐。
  • 在下游 ADMET 预测任务中,使用小规模标签数据集对模型进行微调,利用预训练模型的可泛化表征。
  • 评估了两种变体:一种使用原子环境(AtomEnvs),另一种使用功能环境(FunctionalEnvs),并进行了辅助损失的消融研究。

实验结果

研究问题

  • RQ1基于 Transformer 的模型是否能有效利用原子环境作为标记,直接从分子图中学习分子表征?
  • RQ2两阶段预训练策略(先在结构上进行自监督学习,再在生物性质上进行多任务学习)是否能提升小样本 ADMET 任务的下游性能?
  • RQ3与原子环境相比,使用功能环境(抽象化的化学基团)在模型泛化能力和性能方面表现如何?
  • RQ4在预训练过程中引入辅助自监督目标是否能进一步提升模型在下游任务上的性能?
  • RQ5MolE 在标准化 ADMET 基准测试中,相对于现有最先进模型,其性能提升程度如何?

主要发现

  • MolE 在 Therapeutic Data Commons 基准的 22 项 ADMET 任务中,有 9 项达到最先进性能,优于现有模型的关键指标。
  • 在脂溶性预测任务中,MolE 的平均绝对误差(MAE)为 0.469 ± 0.009,在排行榜中排名第一。
  • 在 VDss 任务中,MolE 的斯皮尔曼等级相关系数为 0.654 ± 0.031,排名第一,显著优于此前最佳模型。
  • 在 CYP2C9 抑制任务中,MolE 的 AUPRC 为 0.801 ± 0.003,排名第一,显著超越此前最佳模型。
  • 在功能环境变体中,自监督预训练结合辅助损失,使模型在 22 项任务中的 4 项上超越排行榜模型。
  • 在已应用监督预训练的情况下,微调 MolE 取得了最佳结果;而当监督预训练已存在时,自监督阶段添加辅助损失并未进一步提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。