Skip to main content
QUICK REVIEW

[论文解读] Enumerating Chemical Graphs with Mono-block 2-Augmented Tree Structure from Given Upper and Lower Bounds on Path Frequencies

Yuui Tamura, Yuhei Nishiyama|arXiv (Cornell University)|Apr 14, 2020
Computational Drug Discovery Methods参考文献 23被引用 5
一句话总结

该论文提出了一种新型分支限界算法,用于在给定路径频率上下限的约束下,高效枚举化学图中的单块2-增强树结构。通过利用单环图与2-增强树之间的父子关系,并精心选择非相邻顶点对以添加边,该方法避免了重复并确保了完备性,在路径频率约束下的枚举任务中,其运行时间和解集规模均显著优于MOLGEN。

ABSTRACT

We consider a problem of enumerating chemical graphs from given constraints concerning their structures, which has an important application to a novel method for the inverse QSAR/QSPR recently proposed. In this paper, the structure of a chemical graph is specified by a feature vector each of whose entries represents the frequency of a prescribed path. We call a graph a 2-augmented tree if it is obtained from a tree (an acyclic graph) by adding edges between two pairs of nonadjacent vertices. Given a set of feature vectors as the interval between upper and lower bounds of feature vectors, we design an efficient algorithm for enumerating chemical 2-augmented trees that satisfy the path frequency specified by some feature vector in the set. We implemented the proposed algorithm and conducted some computational experiments.

研究动机与目标

  • 为逆QSAR/QSPR框架中具有特定结构约束的化学图高效枚举提供支持。
  • 将现有针对无环和单环图的方法扩展至2-增强树,后者在真实化学化合物中广泛存在。
  • 设计一种算法,仅枚举满足给定路径频率上下限的单块2-增强树结构。
  • 克服通用工具MOLGEN的局限性,后者生成过多无约束的图,且缺乏基于结构描述符的过滤能力。
  • 为基于神经网络的逆QSAR/QSPR系统提供一种数学上严谨、高效且完备的枚举方法。

提出的方法

  • 该算法采用分支限界框架,通过在非相邻顶点对之间添加边,从单环图中探索单块2-增强树的结构空间。
  • 定义了单环图与2-增强树之间的父子关系,以确保枚举过程中无重复。
  • 在单环图中选择特定的非相邻顶点对集合,使得在这些顶点对之间添加边可生成唯一且不重叠的2-增强树。
  • 通过剪枝策略强制实施路径频率约束:当当前路径频率超过上限或低于下限时,即剪除对应分支。
  • 该算法集成了图的特征向量表示,其中每一项对应于指定长度路径的频率。
  • 利用先前高效的无环图与单环图枚举算法作为基础,用于构建2-增强树。

实验结果

研究问题

  • RQ1在给定路径频率上下限的约束下,能否实现对单块2-增强树结构的完整且无冗余的枚举?
  • RQ2如何利用单环图与2-增强树之间的父子关系来避免枚举过程中的重复?
  • RQ3何种标准可确保在单环图中选定的非相邻顶点对之间添加边,能生成所有可能的2-增强树而不遗漏?
  • RQ4与通用工具MOLGEN相比,该算法在路径约束枚举任务中的运行时间和解集规模表现如何?
  • RQ5该算法能否高效检测到在给定路径频率边界下不存在任何有效化学图的情况?

主要发现

  • 对于路径频率边界被指定的EULF-L-A实例,所提算法在运行时间和解集规模上均显著优于MOLGEN。
  • 在EULF-L-A实例中,该算法生成的化学图数量远少于MOLGEN,且仅聚焦于满足路径频率约束的单块2-增强树。
  • 通过精心定义父子关系和边添加规则,该算法成功避免了结构间的重复,并确保了枚举的完备性。
  • 对于EULF-L-P实例,即使不存在有效图,该算法仍表现出较高的计算开销,表明需要引入早期终止检测机制。
  • 该方法支持在逆QSAR/QSPR中实现精确、有针对性的化学结构枚举,有助于发现具有期望性质的新化合物。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。