Skip to main content
QUICK REVIEW

[论文解读] Scalable Deep Generative Modeling for Sparse Graphs

Hanjun Dai, Azade Nazi|arXiv (Cornell University)|Jun 28, 2020
Advanced Graph Neural Networks被引用 17
一句话总结

本文提出 BiGG,一种用于稀疏图的可扩展自回归生成模型,通过利用图的稀疏性,将时间复杂度从 Ω(n²) 降低至 O((n+m)log n)。该模型在大规模图(最多 100k 个节点)上实现了最先进(SOTA)的生成质量,且仅需 O(log n) 次同步步骤即可实现高效的并行训练。

ABSTRACT

Learning graph generative models is a challenging task for deep learning and has wide applicability to a range of domains like chemistry, biology and social science. However current deep neural methods suffer from limited scalability: for a graph with $n$ nodes and $m$ edges, existing deep neural methods require $Ω(n^2)$ complexity by building up the adjacency matrix. On the other hand, many real world graphs are actually sparse in the sense that $m\ll n^2$. Based on this, we develop a novel autoregressive model, named BiGG, that utilizes this sparsity to avoid generating the full adjacency matrix, and importantly reduces the graph generation time complexity to $O((n + m)\log n)$. Furthermore, during training this autoregressive model can be parallelized with $O(\log n)$ synchronization stages, which makes it much more efficient than other autoregressive models that require $Ω(n)$. Experiments on several benchmarks show that the proposed approach not only scales to orders of magnitude larger graphs than previously possible with deep autoregressive graph generative models, but also yields better graph generation quality.

研究动机与目标

  • 为解决深度图生成模型中的可扩展性瓶颈,这类模型通常因显式构建完整邻接矩阵而需 Ω(n²) 的时间复杂度。
  • 实现对大规模稀疏图(如 100k 个节点)的训练与生成,而当前自回归模型因二次方时间与内存开销无法处理此类规模。
  • 通过利用稀疏性并设计一种具有次线性同步机制的可并行化自回归结构,降低训练时间与内存使用。
  • 在实现显著复杂度降低的同时,保持或提升在基准数据集上的生成质量。

提出的方法

  • BiGG 使用二叉树数据结构,以每条边 O(log n) 的时间生成边,受 R-MAT 启发,避免显式计算完整邻接矩阵。
  • 采用树状结构的自回归模型,按节点顺序(如 BFS/DFS)生成每条边,以最小化树宽并提升效率。
  • 模型在节点上定义一个自回归序列,其中每个节点的边集条件性地依赖于先前处理过的节点。
  • 通过分层上下文嵌入方案实现训练并行化,仅需 O(log n) 次顺序步骤,实现高效的同步。
  • 训练期间内存使用降低至 O(√(m log n)),推理期间降低至 O(log n),使得在单张 GPU 上训练包含数百万个节点的图成为可能。
  • 模型采用可微采样进行似然目标训练,支持端到端优化,尽管边生成是离散的。

实验结果

研究问题

  • RQ1我们能否设计一种深度图生成模型,使其在不产生 Ω(n²) 复杂度的前提下,高效扩展至大规模稀疏图?
  • RQ2在自回归图模型中,如何在降低时间和内存成本的同时保持高质量的图生成?
  • RQ3我们能否对自回归图模型的训练进行并行化,以相比现有方法显著降低同步开销?
  • RQ4利用图的稀疏性是否能显著提升可扩展性,同时不牺牲生成质量?

主要发现

  • BiGG 实现了 O((n+m)log n) 的图生成时间复杂度,相比先前深度自回归模型的 Ω(n²) 复杂度有显著提升。
  • 该模型成功在单张 GPU 上生成了最多 100,000 个节点的图,其规模比以往自回归深度模型可处理的范围大了几个数量级。
  • 在合成数据集和真实世界数据集(蛋白质、3D 网格、SAT 实例)上,BiGG 的生成质量与 SOTA 模型(如 GRAN)相当或更优,100k 节点网格图的 MMD 分数低至 2.54e-2。
  • 训练同步步骤减少至 O(log n),相比 GraphRNN(Ω(n²))和 GRAN(O(n))实现显著更快的训练速度,同时保持高质量样本。
  • 训练期间内存成本降低至 O(√(m log n)),使得在 GRAN 因内存限制而失败的大型图也能在单张 GPU 上训练。
  • BiGG 在不同边密度下均保持优异性能,即使在 1% 边密度下,谱 MMD 分数也接近真实 Erdős–Rényi 模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。