Skip to main content
QUICK REVIEW

[论文解读] nach0: Multimodal Natural and Chemical Languages Foundation Model

Micha Livne, Zulfat Miftahutdinov|arXiv (Cornell University)|Nov 21, 2023
Topic Modeling参考文献 17被引用 4
一句话总结

本文介绍了 nach0,一种在科学文本和 SMILES 格式分子字符串上联合预训练的多模态编码器-解码器基础模型,旨在统一自然语言与化学语言的理解。通过利用 NVIDIA 的 NeMo 框架进行指令微调,nach0 在多种生物医学与化学任务中实现了最先进性能,包括分子生成、反应预测和生物医学问答。

ABSTRACT

Large Language Models (LLMs) have substantially driven scientific progress in various domains, and many papers have demonstrated their ability to tackle complex problems with creative solutions. Our paper introduces a new foundation model, nach0, capable of solving various chemical and biological tasks: biomedical question answering, named entity recognition, molecular generation, molecular synthesis, attributes prediction, and others. nach0 is a multi-domain and multi-task encoder-decoder LLM pre-trained on unlabeled text from scientific literature, patents, and molecule strings to incorporate a range of chemical and linguistic knowledge. We employed instruction tuning, where specific task-related instructions are utilized to fine-tune nach0 for the final set of tasks. To train nach0 effectively, we leverage the NeMo framework, enabling efficient parallel optimization of both base and large model versions. Extensive experiments demonstrate that our model outperforms state-of-the-art baselines on single-domain and cross-domain tasks. Furthermore, it can generate high-quality outputs in molecular and textual formats, showcasing its effectiveness in multi-domain setups.

研究动机与目标

  • 开发一种统一的基础模型,能够理解并生成自然语言与化学语言表征。
  • 解决现有模型将自然语言与化学结构数据分别处理的局限性,通常忽略 SMILES 格式的分子数据。
  • 通过在科学文献与分子字符串上联合预训练,提升药物发现中的跨领域性能。
  • 通过指令微调实现对多样化化学与生物医学 NLP 任务的少样本与零样本适应。
  • 展示单一模型在处理多任务、多领域设置(包括逆合成、属性预测与分子描述生成)中的有效性。

提出的方法

  • 在大规模语料上预训练基于 Transformer 的编码器-解码器模型,该语料结合了科学文献(如 PubMed、专利)与来自 ZINC15 和 PubChem 的 SMILES 字符串。
  • 采用自监督学习目标(如掩码语言建模与去噪自编码)以学习跨模态的上下文表征。
  • 使用 NVIDIA 的 NeMo 框架对基础版与大版模型进行微调,以实现高效的多 GPU 与分布式训练。
  • 通过任务特定提示(如“描述该分子:C1=CC(=CC=C1...)”)应用指令微调,使模型输出与下游任务需求对齐。
  • 采用统一的词汇表,包含自然语言标记与化学特定标记(如通过正则表达式对 SMILES 进行分词)。
  • 利用基于 T5 的架构,支持在多样化化学与 NLP 任务中进行序列到序列生成与序列到序列分类。

实验结果

研究问题

  • RQ1单一基础模型能否有效统一自然语言与化学结构(如 SMILES)的表征,以支持多领域任务?
  • RQ2与模态专用模型相比,在科学文本与分子字符串上联合预训练是否能提升下游化学与生物医学 NLP 任务的性能?
  • RQ3指令微调在多大程度上能增强多模态基础模型在多样化化学与生物任务中的零样本与少样本泛化能力?
  • RQ4nach0 在跨领域设置中的表现如何,例如从自然语言描述中预测分子属性或生成反应路径?
  • RQ5在逆合成、分子生成与生物医学问答等任务中,统一模型能否超越专用模型?

主要发现

  • nach0 在单领域与跨领域任务中均优于最先进基线模型,包括生物医学问答、命名实体识别与分子属性预测。
  • 该模型在无需任务特定微调的情况下,于分子生成、逆合成与反应预测任务中实现了强大的零样本与少样本性能。
  • 指令微调显著提升了输出质量与任务对齐性,使模型能够生成化学上有效且语义有意义的输出。
  • nach0 在多样化化学与生物任务中表现出稳健的泛化能力,包括分子描述生成与属性预测。
  • 该模型性能与专用模型(如 Chemformer 与 MolT5)相当,同时运行于统一的多任务框架中。
  • 模型权重将在论文被接收后公开发布于 HuggingFace 与 NVIDIA NGC 目录,以促进更广泛的研究与应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。