Skip to main content
QUICK REVIEW

[论文解读] C5T5: Controllable Generation of Organic Molecules with Transformers

Daniel Rothchild, Alex Tamkin|arXiv (Cornell University)|Aug 23, 2021
Molecular Junctions and Nanostructures参考文献 35被引用 17
一句话总结

C5T5 提出了一种基于自监督、基于 Transformer 的方法,通过将 IUPAC 名称视为自然语言,实现零样本、可控的有机分子生成,使领域专家能够通过直观的“选择-替换”编辑来优化分子性质,而无需配对的编辑数据。该方法通过离散化的性质值进行条件控制,并对目标片段进行掩码以实现填充,从而实现可解释的、以性质为导向的分子修改,在优化四种与药物相关的物理性质方面表现出色,采用化学上有效且直观的策略。

ABSTRACT

Methods for designing organic materials with desired properties have high potential impact across fields such as medicine, renewable energy, petrochemical engineering, and agriculture. However, using generative modeling to design substances with desired properties is difficult because candidate compounds must satisfy multiple constraints, including synthetic accessibility and other metrics that are intuitive to domain experts but challenging to quantify. We propose C5T5, a novel self-supervised pretraining method that enables transformers to make zero-shot select-and-replace edits, altering organic substances towards desired property values. C5T5 operates on IUPAC names -- a standardized molecular representation that intuitively encodes rich structural information for organic chemists but that has been largely ignored by the ML community. Our technique requires no edited molecule pairs to train and only a rough estimate of molecular properties, and it has the potential to model long-range dependencies and symmetric molecular structures more easily than graph-based methods. C5T5 also provides a powerful interface to domain experts: it grants users fine-grained control over the generative process by selecting and replacing IUPAC name fragments, which enables experts to leverage their intuitions about structure-activity relationships. We demonstrate C5T5's effectiveness on four physical properties relevant for drug discovery, showing that it learns successful and chemically intuitive strategies for altering molecules towards desired property values.

研究动机与目标

  • 为解决药物发现中设计具有理想物理性质的有机分子的挑战,传统方法受限于巨大的化学空间,且专家直觉未被充分利用。
  • 克服现有生成模型依赖 SMILES 或分子图等原子级表示的局限性,这些表示对化学家而言缺乏直观结构。
  • 开发一种无需配对编辑数据或明确展示期望转化方式的方法,实现细粒度、用户导向的分子优化。
  • 提供一种人机协同接口,通过 IUPAC 名称操作与化学家对结构-活性关系的心理模型保持一致。
  • 通过在粗粒度性质条件下的自监督填充训练,实现在推理时使用期望的目标性质值进行零样本性质导向编辑。

提出的方法

  • C5T5 使用 IUPAC 名称表示有机分子,这是一种语义丰富、标准化的表示方式,能以化学家直观的方式编码官能团和分子对称性。
  • 该模型采用基于 T5 的条件式 Transformer 架构,通过自监督填充目标进行训练,其中 IUPAC 名称中的掩码标记在分子离散化性质值的条件下被预测。
  • 在训练过程中,模型在 IUPAC 名称前附加目标分子性质的离散化区间(例如 logP、溶解度等)作为条件。
  • 在推理阶段,用户选择一个片段进行替换,用占位符标记掩码,并将模型条件于期望的性质区间(例如 <high> 表示提高 logP),从而促使模型生成新片段。
  • 该方法支持零样本编辑:无需配对的编辑示例,因为模型能从无配对分子和性质估计的自监督预训练中泛化。
  • 该接口允许领域专家基于其化学直觉,通过选择性替换片段迭代优化分子,模型则生成化学上合理且性质导向的替代方案。

实验结果

研究问题

  • RQ1基于 IUPAC 名称的自监督语言建模方法是否能实现在无需配对编辑数据或示范的情况下,实现零样本、可控的分子编辑?
  • RQ2当仅基于粗粒度性质估计和掩码片段时,Transformer 模型在生成化学上直观且有效的分子修改方面表现如何?
  • RQ3与 SMILES 或基于图的表示相比,使用 IUPAC 名称作为表示在可解释性和与专家直觉的对齐方面有多大提升?
  • RQ4模型是否能在未显式监督此类策略的情况下,发现并应用已知的构效关系(例如,添加疏水链以提高 logP)?
  • RQ5该方法在生成具有期望物理性质变化的分子方面有多高效,这些性质与药物发现相关,如 logP、溶解度和熔点?

主要发现

  • C5T5 有效学习到生成化学上直观的编辑,例如通过将亲水基团替换为长链脂肪族基团以增强疏水性,从而提高分子的辛醇-水分配系数(logP)。
  • 当输入的 IUPAC 名称编码对称性时(例如包含 'bis' 或 'diol' 等术语),模型能生成对称分子,展现出对结构模式的保留或扩展能力。
  • 对于具有对称骨架的分子,C5T5 能生成有效且对称的输出(例如,在对称二醇中将 'ol' 替换为 'sulfinic acid'),表明其对结构复杂性的鲁棒性。
  • 模型提出的编辑与已知化学原理一致:例如,它会添加疏水片段以提高 logP,或添加亲水基团以降低 logP,即使训练数据中没有此类示例。
  • 尽管表现优异,该模型偶尔会生成不稳定化合物(例如,相邻的 NH2 基团易被氧化),凸显了在流程中引入专家验证的必要性。
  • 该方法通过结合化学家领域知识的“选择-替换”接口,实现了细粒度、专家引导的优化,为黑箱生成提供了一种实用的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。