Skip to main content
QUICK REVIEW

[论文解读] Text-Guided Molecule Generation with Diffusion Language Model

Haisong Gong, Qiang Liu|arXiv (Cornell University)|Feb 20, 2024
Chemical Synthesis and Analysis被引用 4
一句话总结

该论文提出TGM-DLM,一种用于文本引导分子生成的扩散语言模型,采用两阶段流程:首先利用文本指导从噪声中优化SMILES标记嵌入,然后在无文本输入的情况下修正无效的SMILES字符串。该方法在无需额外数据的情况下,优于自回归模型(如MolT5-Base),在有效性和分子相似性指标上表现更优,证明了基于扩散的方法在可控、精确的分子设计中具有优越性。

ABSTRACT

Text-guided molecule generation is a task where molecules are generated to match specific textual descriptions. Recently, most existing SMILES-based molecule generation methods rely on an autoregressive architecture. In this work, we propose the Text-Guided Molecule Generation with Diffusion Language Model (TGM-DLM), a novel approach that leverages diffusion models to address the limitations of autoregressive methods. TGM-DLM updates token embeddings within the SMILES string collectively and iteratively, using a two-phase diffusion generation process. The first phase optimizes embeddings from random noise, guided by the text description, while the second phase corrects invalid SMILES strings to form valid molecular representations. We demonstrate that TGM-DLM outperforms MolT5-Base, an autoregressive model, without the need for additional data resources. Our findings underscore the remarkable effectiveness of TGM-DLM in generating coherent and precise molecules with specific properties, opening new avenues in drug discovery and related scientific domains. Code will be released at: https://github.com/Deno-V/tgm-dlm.

研究动机与目标

  • 为解决自回归模型在文本引导分子生成中的局限性,这些模型因固定生成顺序而难以处理全局约束。
  • 探索基于SMILES的生成中扩散模型的应用,实现分子表示的全局与迭代优化。
  • 通过引入针对无效SMILES字符串的专用修正阶段,提升分子有效性与文本描述的一致性。
  • 证明基于扩散的生成方法可在生成连贯、精确且有效的分子方面超越自回归基线模型。

提出的方法

  • TGM-DLM采用两阶段扩散生成流程:第一阶段利用文本描述作为指导,从随机噪声中优化SMILES标记嵌入。
  • 第二阶段通过迭代优化嵌入(无文本输入)来修正无效SMILES字符串,重点提升结构有效性。
  • 模型通过两个目标进行训练:第一阶段使用文本指导进行嵌入去噪,第二阶段通过从受损输入中恢复原始SMILES进行训练。
  • 两个阶段均采用共享的基于Transformer的架构,通过独立的训练目标平衡初始文本对齐与结构修正。
  • 修正阶段使用独立的网络头来优化分子表示,同时保持语义一致性。
  • 该方法将SMILES视为标记序列,对嵌入进行集体优化,而非自回归方式。

实验结果

研究问题

  • RQ1基于扩散的方法是否能通过更好地处理全局约束,在文本引导的SMILES生成中超越自回归模型?
  • RQ2两阶段扩散流程(先由文本引导,再修正结构错误)在提升分子有效性和质量方面有多有效?
  • RQ3在修正阶段引入文本输入是否能增强模型生成有效且相关分子的能力?
  • RQ4扩散模型在不依赖额外预训练数据或外部数据集微调的情况下,能在多大程度上提升分子生成性能?

主要发现

  • TGM-DLM在ChEBI-20数据集上达到88.3%的有效性,显著高于无修正变体的78.9%。
  • 该模型将精确匹配得分提升至MolT5-Base的三倍,表明在生成正确分子字符串方面具有更高的精度。
  • 与MolT5-Base相比,TGM-DLM在指纹相似性指标(MACCS FTS)上提高了18%至36%,表明分子结构对齐更优。
  • 当使用一步第二阶段时,有效性从78.9%提升至87.1%,证明了结构优化的有效性。
  • 在修正阶段使用文本输入无法将有效性提升至82.4%以上,表明这可能妨碍模型修复结构错误的能力。
  • 在单一网络中联合训练两个阶段的性能劣于独立训练,表明不同目标通过独立优化更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。