Skip to main content
QUICK REVIEW

[论文解读] Data-Efficient Graph Grammar Learning for Molecular Generation

Minghao Guo, Veronika Thost|arXiv (Cornell University)|Mar 15, 2022
Machine Learning in Materials ScienceMaterials Science被引用 17
一句话总结

该论文提出了一种数据高效的图语法学习框架,用于分子生成,能够从极少的训练数据(仅11–32个样本)中自动构建可解释的、基于子结构的生成规则。通过联合优化分子多样性、可合成性及分布一致性,该方法在单体和聚合物生成任务中实现了最先进性能,且所需数据量较标准深度学习基线少几个数量级。

ABSTRACT

The problem of molecular generation has received significant attention recently. Existing methods are typically based on deep neural networks and require training on large datasets with tens of thousands of samples. In practice, however, the size of class-specific chemical datasets is usually limited (e.g., dozens of samples) due to labor-intensive experimentation and data collection. This presents a considerable challenge for the deep learning generative models to comprehensively describe the molecular design space. Another major challenge is to generate only physically synthesizable molecules. This is a non-trivial task for neural network-based generative models since the relevant chemical knowledge can only be extracted and generalized from the limited training data. In this work, we propose a data-efficient generative model that can be learned from datasets with orders of magnitude smaller sizes than common benchmarks. At the heart of this method is a learnable graph grammar that generates molecules from a sequence of production rules. Without any human assistance, these production rules are automatically constructed from training data. Furthermore, additional chemical knowledge can be incorporated in the model by further grammar optimization. Our learned graph grammar yields state-of-the-art results on generating high-quality molecules for three monomer datasets that contain only ${\sim}20$ samples each. Our approach also achieves remarkable performance in a challenging polymer generation task with only $117$ training samples and is competitive against existing methods using $81$k data points. Code is available at https://github.com/gmh14/data_efficient_grammar.

研究动机与目标

  • 为解决在特殊化学领域(如聚合物单体)中常见的极小规模训练数据下的分子生成挑战。
  • 克服深度学习模型依赖大规模数据集、常生成无效或不可合成分子的局限性。
  • 开发一种基于语法规则的生成模型,兼具数据高效性,并能融入超越基本化合价规则的复杂化学知识。
  • 无需人工设计规则,即可从数据中自动构建图语法,同时优化多样性、可合成性等关键化学指标。
  • 即使在训练数据稀缺的情况下,也能实现高质量、物理上合理的分子生成,尤其适用于特定类别的化学空间。

提出的方法

  • 该方法通过自动发现能够通过子结构级变换生成有效分子结构的生成规则,从分子训练数据中学习图语法。
  • 语法构建过程通过加权损失函数中的平衡因子λ,联合优化多个化学目标——多样性、可合成性(RS)和分布相似性。
  • 通过图结构上的可微优化学习生成规则,使模型能够捕捉复杂子结构(如环状结构、官能团),而不仅限于逐原子添加。
  • 该框架支持端到端训练,并可结合额外的化学约束或指标进行微调,实现领域特定知识的集成。
  • 模型采用符号化、基于规则的表示,确保可解释性,并支持官能团的提取与分析。
  • 该方法在单体和聚合物数据集上进行了评估,包括一个117个样本的聚合物数据集和三个仅约20个样本的单体数据集。

实验结果

研究问题

  • RQ1能否在无需人工设计规则的前提下,仅从极少量化学数据(如11–32个样本)中自动构建图语法?
  • RQ2当训练数据极度有限时,与深度学习基线相比,该数据高效基于语法的模型在分子生成任务中的表现如何?
  • RQ3语法构建过程能否在保持结构有效性的前提下,有效优化复杂化学指标(如多样性与可合成性)?
  • RQ4所学语法在生成训练集中未出现的新型、物理上合理的分子方面,其泛化能力有多强?
  • RQ5不同优化目标之间的平衡(如多样性与可合成性)如何影响生成分子的质量与多样性?

主要发现

  • 所提方法在仅各约20个训练样本的三个单体数据集上实现了最先进性能,其样本质量与分布一致性均优于现有基于语法和深度学习的模型。
  • 在包含117个样本的具有挑战性的聚合物生成任务中,该模型性能可与在81,000个数据点上训练的现有方法相媲美。
  • 该模型生成了如环辛烷等新颖且复杂的分子,这些分子在训练数据中并不存在,表明其具备强大的泛化能力与结构创造力。
  • 生成分子的Chamfer距离是HierVAE等强基线模型的两倍,表明尽管数据极少,其分布对齐性能仍更优。
  • 平衡因子λ成功控制了多样性与可合成性之间的权衡,当λ₁=1、λ₂=2时,实现了性能的良好平衡。
  • 各单体类别的特征官能团(如异氰酸酯)被自动识别为共享的生成规则,证实了模型的可解释性及其与化学知识的一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。