Skip to main content
QUICK REVIEW

[论文解读] DrugLLM: Open Large Language Model for Few-shot Molecule Generation

Xianggen Liu, Yan Guo|arXiv (Cornell University)|May 7, 2024
Computational Drug Discovery Methods被引用 4
一句话总结

DrugLLM 是一个经过微调的 70 亿参数大语言模型,用于使用基于分组的分子表征(GMR)进行少样本小分子生成,该表征将分子编码为功能基团及其位置的结构化序列。它在仅使用少量修改示例的情况下,生成具有期望性质的新分子方面达到了最先进性能,在少样本和零样本设置下均优于现有的深度学习和大语言模型基线。

ABSTRACT

Large Language Models (LLMs) have made great strides in areas such as language processing and computer vision. Despite the emergence of diverse techniques to improve few-shot learning capacity, current LLMs fall short in handling the languages in biology and chemistry. For example, they are struggling to capture the relationship between molecule structure and pharmacochemical properties. Consequently, the few-shot learning capacity of small-molecule drug modification remains impeded. In this work, we introduced DrugLLM, a LLM tailored for drug design. During the training process, we employed Group-based Molecular Representation (GMR) to represent molecules, arranging them in sequences that reflect modifications aimed at enhancing specific molecular properties. DrugLLM learns how to modify molecules in drug discovery by predicting the next molecule based on past modifications. Extensive computational experiments demonstrate that DrugLLM can generate new molecules with expected properties based on limited examples, presenting a powerful few-shot molecule generation capacity.

研究动机与目标

  • 为解决药物发现中少样本分子生成的挑战,传统深度学习模型受限于数据稀缺。
  • 提升大语言模型理解并生成具有特定药理性质分子的能力。
  • 开发一种利用新型分子表征(GMR)捕捉分子结构-性质关系的方法。
  • 通过从有限的修改示例中学习,实现分子的有效少样本和零样本优化。
  • 通过将大语言模型适配至分子生成任务,弥合自然语言建模与化学语言之间的差距。

提出的方法

  • DrugLLM 使用修改后的 LLaMA 架构,包含 32 层、32 个注意力头和 4096 个隐藏维度,基于精心筛选的分子修改序列数据集进行微调。
  • 分子通过基于分组的分子表征(GMR)表示,该方法将 SMILES 字符串分解为结构片段及其位置索引,提升了可解释性并减少了标记歧义。
  • 训练目标是在优化描述和分子修改序列上进行自回归的下一个标记预测,使模型能够学习转化模式。
  • 模型在分子修改案例数据集上进行微调,每个输入序列包含目标性质变化的描述以及若干示例修改。
  • 推理过程中,DrugLLM 通过给定少数示例修改(少样本)或任务描述(零样本)来预测序列中的下一个分子,从而生成新分子。
  • 解码过程利用连接信息和位置信息,从 GMR 编码的片段重建分子,确保结构正确性和可逆性。

实验结果

研究问题

  • RQ1大语言模型能否被有效微调以实现高精度和化学有效性的少样本分子生成?
  • RQ2与标准 SMILES 相比,基于分组的分子表征(GMR)在建模分子结构和修改模式方面有何改进?
  • RQ3DrugLLM 在仅使用少量示例的情况下,对新型分子优化任务的泛化能力如何?
  • RQ4在少样本分子生成方面,DrugLLM 与现有深度生成模型(如 JTVAE、VJTNN、MoLeR)和通用大语言模型(如 GPT-4、ChatGLM)相比表现如何?
  • RQ5DrugLLM 能否在没有任何微调示例的情况下实现零样本分子优化,仅依赖任务描述?

主要发现

  • DrugLLM 在少样本分子生成方面达到最先进性能,显著优于 JTVAE、VJTNN 和 MoLeR 等基线模型,在生成具有目标性质的分子方面表现更优。
  • 模型在零样本设置下展现出强大的泛化能力,仅基于任务描述和一个查询分子即可生成化学有效且性质优化的分子。
  • 基于 GMR 的表征实现了更准确且可解释的分子编码,减少了标记歧义,并在生成过程中提升了结构保真度。
  • 由于领域特定的微调和表征设计,DrugLLM 在分子生成任务中优于通用大语言模型(如 GPT-4 和 ChatGLM),即使使用精心设计的提示亦如此。
  • 与基线相比,DrugLLM 生成的分子具有更高的性质评分(如 logP、QED、SA 分数),表明其在优化期望药理性质方面表现更优。
  • 广泛的消融研究证实,GMR 表征和少样本微调策略对模型性能均至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。