Skip to main content
QUICK REVIEW

[论文解读] The general theory of permutation equivarant neural networks and higher order graph variational encoders

Erik H. Thiede, Truong Son Hy|arXiv (Cornell University)|Apr 8, 2020
Advanced Graph Neural Networks参考文献 39被引用 4
一句话总结

本文提出了一种关于高阶交互作用的排列等变神经网络的一般理论,引入了可同时对矩阵的行和列进行排列的二阶等变层——这对图学习和关系学习至关重要。作者提出了一种二阶图变分自编码器,在ZINC分子生成基准上实现了98.4%的重建准确率,优于使用显式化学先验知识的方法,并证明此类模型的潜在分布必须是可交换的。

ABSTRACT

Previous work on symmetric group equivariant neural networks generally only considered the case where the group acts by permuting the elements of a single vector. In this paper we derive formulae for general permutation equivariant layers, including the case where the layer acts on matrices by permuting their rows and columns simultaneously. This case arises naturally in graph learning and relation learning applications. As a specific case of higher order permutation equivariant networks, we present a second order graph variational encoder, and show that the latent distribution of equivariant generative models must be exchangeable. We demonstrate the efficacy of this architecture on the tasks of link prediction in citation graphs and molecular graph generation.

研究动机与目标

  • 将排列等变神经网络的理论从一阶作用(排列向量元素)扩展到更高阶作用,例如对矩阵的行和列进行同步排列。
  • 形式化高阶等变层的结构与参数化,特别是图表示学习中出现的二阶作用。
  • 开发一种对邻接矩阵的排列对称性保持不变的二阶图变分自编码器(VAE),并能生成有效的分子图。
  • 研究排列等变生成模型与贝叶斯非参数统计中可交换分布之间的联系。
  • 通过链路预测和分子图生成任务的实证验证,表明尽管未引入显式化学知识,该架构仍能取得性能提升。

提出的方法

  • 推导了在任意对称群作用下作用于张量的排列等变线性层的一般公式,包括对矩阵的二阶作用。
  • 应用对称群的表示理论对等变层进行分类,并确定每一层中可学习参数的数量。
  • 构建了一种二阶图变分自编码器,其中编码器和解码器均对邻接矩阵的行和列的同步排列保持等变性。
  • 采用变分推理框架,其潜在空间具有可交换性(但不一定是i.i.d.),以确保生成过程中的对称性。
  • 对离散键特征采用连续松弛方法,以实现从潜在空间的可微分分子生成。
  • 使用VAE目标函数进行训练,消融实验表明,当关闭KL散度项时性能有所提升。

实验结果

研究问题

  • RQ1如何将排列等变神经网络从一阶作用推广到更高阶作用,例如对矩阵的行和列进行同步排列?
  • RQ2在二阶对称群作用下,等变层的数学结构是什么?其可学习参数的数量是多少?
  • RQ3是否可以设计一种二阶排列等变图变分自编码器,在不使用显式化学先验或基于规则的约束条件下生成有效的分子图?
  • RQ4排列等变性对生成模型中潜在分布施加了何种约束?这与可交换性有何关联?
  • RQ5高阶等变性是否能在链路预测和分子生成等图表示学习任务中带来性能提升?

主要发现

  • 所提出的二阶图变分自编码器在ZINC分子生成基准上实现了98.4%的重建准确率,显著优于CVAE(44.6%)和GVAE(53.7%)等方法。
  • 尽管缺乏显式化学知识(如价键规则或官能团约束),该模型仍能从先验分布中生成33.4%的有效分子,优于SD-VAE(43.5%)和GraphVAE(13.5%)的有效性表现。
  • 该模型生成的分子具有合理的碳骨架和成键模式,但表现出对小分子和应变环系统(如四元环)的偏好。
  • 在VAE损失中禁用KL散度项可提高重建准确率,表明模型的归纳偏差在无后验坍缩正则化时可能得到更好保留。
  • 该模型的潜在空间具有可交换性,证实了排列等变生成模型与贝叶斯非参数统计中可交换序列之间的理论联系。
  • 结果表明,高阶等变性使模型能够直接从数据中学习复杂结构模式(如成环),即使没有显式的化学规则。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。