Skip to main content
QUICK REVIEW

[论文解读] FastFlows: Flow-Based Models for Molecular Graph Generation

Nathan C. Frey, Vijay Gadepally|arXiv (Cornell University)|Jan 28, 2022
Machine Learning in Materials Science被引用 16
一句话总结

FastFlows 提出了一种基于归一化流的生成模型,用于分子图生成,采用 SELFIES 编码确保化学有效性,并实现超高速采样——每秒超过 24,000 个分子——即使仅使用 100 个训练分子,也能实现高有效性、新颖性和唯一性。该框架支持多目标优化,兼顾药物样性、合成可及性和复杂性,高效识别帕累托最优候选分子。

ABSTRACT

We propose a framework using normalizing-flow based models, SELF-Referencing Embedded Strings, and multi-objective optimization that efficiently generates small molecules. With an initial training set of only 100 small molecules, FastFlows generates thousands of chemically valid molecules in seconds. Because of the efficient sampling, substructure filters can be applied as desired to eliminate compounds with unreasonable moieties. Using easily computable and learned metrics for druglikeness, synthetic accessibility, and synthetic complexity, we perform a multi-objective optimization to demonstrate how FastFlows functions in a high-throughput virtual screening context. Our model is significantly simpler and easier to train than autoregressive molecular generative models, and enables fast generation and identification of druglike, synthesizable molecules.

研究动机与目标

  • 开发一种快速、数据高效的生成模型,用于小分子设计,避免自回归模型存在的训练不稳定和采样缓慢问题。
  • 通过使用 SELFIES(一种语法强制的分子表示)确保化学有效性,无需事后校正。
  • 通过结合快速采样与子结构过滤及多目标优化,实现高通量虚拟筛选。
  • 证明归一化流在低数据环境下实现靶向化学空间探索的可行性。
  • 高效识别在药物样性、合成可及性和复杂性之间实现平衡的帕累托最优分子。

提出的方法

  • 该模型使用归一化流(NFs)和 Real NVP 变换,将标准正态基分布映射到潜在空间中的目标分子分布。
  • 分子以 SELFIES 字符串表示,该表示强制遵守化合价和成键规则,无需事后校正即可保证语法和语义有效性。
  • SELFIES 字符串经过独热编码,并通过均匀噪声进行去量化,以支持连续训练,同时通过向下取整操作实现精确恢复。
  • 该流架构包含 32 层,每层包含 8 个残差块,并采用棋盘掩码策略,实现高效且可并行化的采样。
  • 生成后应用子结构过滤器以剔除不良片段,同时计算 QED、合成可及性(SA)和合成复杂性(SCScore)等指标,用于多目标优化。
  • 通过支配性检查执行帕累托前沿识别,以选择在多个目标上均无支配关系的分子。

实验结果

研究问题

  • RQ1仅用 100 个分子进行训练的归一化流能否大规模生成化学有效、新颖且唯一的分子?
  • RQ2SELFIES 表示能否消除基于流的分子生成中对事后有效性校正的需求?
  • RQ3在低数据环境下,基于流的模型在保持高质量分布的前提下,采样速度能有多快?
  • RQ4在药物样性、合成可及性和复杂性上的多目标优化能否高效识别高潜力候选分子?
  • RQ5当应用于 ChEMBL 等高维化学空间时,归一化流在计算和架构上存在哪些限制?

主要发现

  • 在 QM9 上训练时,FastFlows 每秒可生成超过 24,000 个分子,展现出极高的采样效率。
  • 仅用 100 个训练分子,FastFlows 即实现了高有效性、新颖性和唯一性,且无需事后校正,归功于 SELFIES 编码。
  • 在子结构过滤和多目标优化后,QM9 实验中帕累托前沿候选分子从超过 2,000 个减少至仅 3 个分子。
  • 在 ChEMBL 上,模型每秒生成 481 个分子,表明其在更高维、更复杂分子上的可扩展性,尽管维度增加。
  • 通过标准指标 QED、SA 和 SCScore 验证了模型性能,这些指标与模型质量相关,且在帕累托优化中具有实用价值。
  • 尽管速度极快,但高维化学空间中仍需深度架构和大量双射变换,这仍是计算瓶颈。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。