Skip to main content
QUICK REVIEW

[论文解读] SMILES-Mamba: Chemical Mamba Foundation Models for Drug ADMET Prediction

Bohao Xu, Yingzhou Lu|arXiv (Cornell University)|Aug 11, 2024
Computational Drug Discovery Methods被引用 4
一句话总结

SMILES-Mamba 是一种两阶段分子基础模型,通过在无标签 SMILES 字符串上进行自监督预训练,随后在有标签的 ADMET 数据集上微调,实现了在 22 项 ADMET 预测任务中的最先进性能——在 14 项任务中排名第一,在 17 项任务中位列前二,证明了自监督学习在减少对大规模有标签数据集依赖方面的强大能力,适用于药物性质预测。

ABSTRACT

In drug discovery, predicting the absorption, distribution, metabolism, excretion, and toxicity (ADMET) properties of small-molecule drugs is critical for ensuring safety and efficacy. However, the process of accurately predicting these properties is often resource-intensive and requires extensive experimental data. To address this challenge, we propose SMILES-Mamba, a two-stage model that leverages both unlabeled and labeled data through a combination of self-supervised pretraining and fine-tuning strategies. The model first pre-trains on a large corpus of unlabeled SMILES strings to capture the underlying chemical structure and relationships, before being fine-tuned on smaller, labeled datasets specific to ADMET tasks. Our results demonstrate that SMILES-Mamba exhibits competitive performance across 22 ADMET datasets, achieving the highest score in 14 tasks, highlighting the potential of self-supervised learning in improving molecular property prediction. This approach not only enhances prediction accuracy but also reduces the dependence on large, labeled datasets, offering a promising direction for future research in drug discovery.

研究动机与目标

  • 通过利用无标签和有标签的分子数据,解决 ADMET 性质预测中的高成本和数据稀缺问题。
  • 通过自监督表征学习,提高对药物吸收、分布、代谢、排泄和毒性预测的准确性。
  • 通过在大规模无标签 SMILES 字符串语料库上进行预训练,减少对大型昂贵有标签数据集的依赖。
  • 开发一种基础模型架构,以捕捉复杂化学结构关系,从而在多样化的 ADMET 任务中实现更好的泛化能力。

提出的方法

  • 采用两阶段训练范式:在大规模无标签 SMILES 字符串语料库上进行自监督预训练,随后在有标签的 ADMET 数据集上进行特定任务的微调。
  • 使用 Mamba 架构——一种状态空间模型(SSM)变体——专为长序列建模优化,以捕捉 SMILES 序列中的长程依赖关系。
  • 在预训练阶段应用掩码语言建模(MLM)目标,以预测 SMILES 字符串中的掩码标记,使模型能够学习化学语法规则和结构模式。
  • 使用标准机器学习头对预训练的 Mamba 编码器在 22 个多样化的 ADMET 数据集上进行微调,涵盖回归任务(如 LD50)和分类任务(如 hERG、AMES)。
  • 采用 SMILES 作为输入表示,实现对分子序列的高效处理,同时保留化学语义。
  • 集成残差连接和层归一化,以稳定训练过程并提升在多样化 ADMET 预测任务中的收敛性能。

实验结果

研究问题

  • RQ1基于 Mamba 架构的基础模型是否能仅使用 SMILES 输入,在预测多样化 ADMET 性质方面超越现有最先进模型?
  • RQ2在大规模无标签 SMILES 数据上进行自监督预训练,在多大程度上提升了下游 ADMET 预测性能?
  • RQ3与 GCN、CNN 和 MLP 等传统模型相比,基于 Mamba 的架构在捕捉 SMILES 序列中的长程化学依赖关系方面表现如何?
  • RQ4所提出的两阶段训练策略(预训练 + 微调)是否在具有不同数据分布的多个 ADMET 任务中均带来一致的性能提升?
  • RQ5尽管不同 ADMET 终点具有不同的化学和生物学基础,该模型是否仍能有效泛化?

主要发现

  • SMILES-Mamba 在 22 项 ADMET 预测任务中的 14 项中表现最佳,表明其在多样化药物性质终点上具有强大的泛化能力。
  • 在 hERG 数据集上,SMILES-Mamba 的 AUC-ROC 达到 0.708 ± 0.045,在所有方法中排名第二,且在稳定性方面显著优于基线模型。
  • 在 DILI 数据集上,SMILES-Mamba 的 AUC-ROC 达到 0.928 ± 0.022,显著优于第二名方法(NeuralFP 的 0.851 ± 0.026)。
  • 该模型在 22 项任务中的 17 项中位列前二,表明其在多样化 ADMET 预测挑战中表现出一致且稳健的性能。
  • 自监督预训练被证明极为有效,SMILES-Mamba 和 NeuralFP 等模型显著优于未进行预训练的传统模型。
  • 没有单一模型在所有任务中占据主导地位,凸显了模型架构设计和表征学习在捕捉任务特异性化学特征方面的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。