[论文解读] Graph Convolutional Neural Networks via Motif-based Attention
本文提出MA-GCNN,一种新颖的图卷积网络,通过基于基序匹配的子图归一化和子图级别的自注意力机制,提升图分类性能。通过基序匹配将图数据转换为网格化结构表示,并在子图上应用注意力机制,MA-GCNN在生物信息学和社交网络数据集上均取得当前最优性能,显著优于现有的深度学习与图核方法。
Many real-world problems can be represented as graph-based learning problems. In this paper, we propose a novel framework for learning spatial and attentional convolution neural networks on arbitrary graphs. Different from previous convolutional neural networks on graphs, we first design a motif-matching guided subgraph normalization method to capture neighborhood information. Then we implement subgraph-level self-attentional layers to learn different importances from different subgraphs to solve graph classification problems. Analogous to image-based attentional convolution networks that operate on locally connected and weighted regions of the input, we also extend graph normalization from one-dimensional node sequence to two-dimensional node grid by leveraging motif-matching, and design self-attentional layers without requiring any kinds of cost depending on prior knowledge of the graph structure. Our results on both bioinformatics and social network datasets show that we can significantly improve graph classification benchmarks over traditional graph kernel and existing deep models.
研究动机与目标
- 为解决在任意图中捕捉丰富空间与结构信息以实现图分类的挑战。
- 克服现有图卷积网络依赖先验知识或无法建模子图级别重要性的局限。
- 开发一种子图级别的注意力机制,可在无需结构先验的情况下,为不同子图学习动态权重。
- 通过新颖的归一化与卷积技术,保留邻域与基序级别的结构信息,提升图分类准确率。
- 提供一个端到端、可解释的图分类框架,适用于多种图类型。
提出的方法
- 提出一种基于基序匹配的子图归一化方法,将图结构数据转换为二维网格化表示,保留空间关系。
- 设计与子图无关的卷积神经网络,在归一化后的子图上运行,无需池化操作,实现在子图级别的特征学习。
- 引入子图级别的自注意力机制,跨不同子图计算注意力权重,动态强调更具判别性的子结构。
- 将每个子图内多个卷积核的特征图拼接,并应用自注意力机制,学习每个子图向量的重要性得分。
- 利用基序匹配在不同图中定义一致的子图模板,实现在大小不一且无序图上的统一表示学习。
- 采用端到端训练框架,整合基序匹配、子图卷积与自注意力机制,实现联合优化。
实验结果
研究问题
- RQ1基于基序匹配的子图归一化是否能有效保留任意图中的空间与结构信息?
- RQ2子图级别的自注意力机制是否能通过学习不同子图的动态重要性权重,提升图分类性能?
- RQ3所提出的MA-GCNN框架是否在多样化的图分类基准上优于现有的图核与深度学习方法?
- RQ4该模型在不同类型的图(如生物信息学与社交网络)上表现如何,尤其在节点属性特征各异的情况下?
- RQ5注意力机制是否能提供可解释的洞察,揭示哪些子图模式对分类最具预测性?
主要发现
- 在五个生物信息学数据集上,MA-GCNN取得最先进准确率,其中IMDB-BINARY为77.20% ± 2.96,IMDB-MULTI为53.77% ± 3.11,全面超越所有基线模型。
- 在PTC数据集上,MA-GCNN达到71.77%的准确率,较最佳基线(NEST)提升4.35%。
- 在D&D数据集上,MA-GCNN达到89.44%的准确率,较DIFFPOOL提升1.25%,且标准差更低。
- 在NCI1数据集上,MA-GCNN达到75.10% ± 3.14的准确率,较PSCN提升3.18%,并在十折交叉验证中的六次中达到SOTA。
- 在社交网络数据集上,MA-GCNN在IMDB-B、IMDB-M、REDDIT-BINARY、REDDIT-MULTU-5K与REDDIT-MULTU-12K上,分别较最佳基线提升2.75%、0.69%、0.92%、1.44%与1.10%的平均准确率。
- 该模型在所有数据集上均表现出较低的标准差,表明性能稳定且鲁棒。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。