Skip to main content
QUICK REVIEW

[论文解读] MolXPT: Wrapping Molecules with Text for Generative Pre-training

Zequn Liu, Wei Zhang|arXiv (Cornell University)|May 18, 2023
Computational Drug Discovery Methods被引用 7
一句话总结

MolXPT 是一个在科学文本、SMILES 序列以及将分子名称与其对应 SMILES 交错嵌入的‘包裹’序列上预训练的 350M 参数生成式语言模型。通过这种包裹技术联合建模文本与分子结构,MolXPT 在分子性质预测(MoleculeNet)任务上达到最先进性能,在文本-分子翻译任务上表现与更大模型相当但参数量减少 44%,并在无需微调的情况下实现强大的零样本分子生成能力。

ABSTRACT

Generative pre-trained Transformer (GPT) has demonstrates its great success in natural language processing and related techniques have been adapted into molecular modeling. Considering that text is the most important record for scientific discovery, in this paper, we propose MolXPT, a unified language model of text and molecules pre-trained on SMILES (a sequence representation of molecules) wrapped by text. Briefly, we detect the molecule names in each sequence and replace them to the corresponding SMILES. In this way, the SMILES could leverage the information from surrounding text, and vice versa. The above wrapped sequences, text sequences from PubMed and SMILES sequences from PubChem are all fed into a language model for pre-training. Experimental results demonstrate that MolXPT outperforms strong baselines of molecular property prediction on MoleculeNet, performs comparably to the best model in text-molecule translation while using less than half of its parameters, and enables zero-shot molecular generation without finetuning.

研究动机与目标

  • 通过在科学文本和 SMILES 序列上联合预训练,提升分子表征学习能力。
  • 解决现有模型未能显式利用分子名称与其结构表示之间语义关系的局限性。
  • 实现无需微调的零样本分子生成以及在多样化分子与文本任务间的少样本迁移学习。
  • 在保持或提升性能的同时,减少与当前最先进模型相比的模型规模,尤其在多模态分子生成任务中。

提出的方法

  • MolXPT 在三种数据源上进行预训练:PubMed 标题与摘要、PubChem SMILES 序列,以及 800 万条‘包裹’序列,其中分子名称被其对应的 SMILES 替代。
  • 使用 BERN2 进行命名实体识别(NER),以识别文本中的分子提及,并通过 ChEBI 等知识库中的实体链接获取 SMILES。
  • 通过将检测到的分子名称替换为 SMILES,构建‘包裹’序列,形成保留上下文与结构信息的混合文本-SMILES 序列。
  • 分开展 tokenization:文本使用 BPE(40k 拆分),SMILES 使用基于正则表达式的 tokenization,并为分子的起始与结束添加特殊 token。
  • 模型采用 24 层 Transformer 架构,参数量为 350M,通过在所有三种数据类型上进行掩码语言建模进行训练。
  • 微调通过提示(prompt-based)方式在下游任务(如分子性质预测与文本到分子生成)上进行。

实验结果

研究问题

  • RQ1通过在文本与 SMILES 序列上联合预训练,并利用包裹序列实现显式对齐,是否能提升分子表征学习能力?
  • RQ2MolXPT 在 MoleculeNet 等分子性质预测基准上是否优于现有的 GNN 模型与多模态模型?
  • RQ3MolXPT 是否能在参数量显著少于当前最先进模型的前提下,实现与之相当的文本-分子翻译性能?
  • RQ4MolXPT 在无需微调的情况下,其零样本文本到分子生成能力在多大程度上表现良好?
  • RQ5与在原始文本与 SMILES 上端到端预训练的模型相比,使用包裹序列在模型对齐与下游性能方面有何差异?

主要发现

  • MolXPT 在 MoleculeNet 基准上优于强基线 GNN 模型,平均 RMSE 达到 0.859,优于先前方法如 GEM。
  • 在 CheBI-20 文本-分子翻译数据集上,MolXPT 的性能与参数量为 800M 的 MolT5-large 相当,仅使用其 44% 的参数,BLEU 得分为 0.859,Text2Mol 得分为 0.983。
  • 在零样本文本到分子生成中,MolXPT 在无需微调的情况下,达到 0.540(MACCS)、0.383(RDK)与 0.228(Morgan)指纹的 top-1 Tanimoto 相似度,证明其生成具有实际意义。
  • 在零样本设置下,模型成功从文本描述中恢复出 33 种分子,证实其具备泛化到未见生成任务的能力。
  • 使用包裹序列显著优于像 Galactica 这类在原始文本与 SMILES 上预训练但缺乏显式对齐的模型,表明结构化跨模态监督的价值。
  • 在分子到文本生成任务上,MolXPT 达到最先进性能,METEOR 得分为 0.757,Text2Mol 得分为 0.983,优于 MolT5-small 与 MolT5-base。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。