[论文解读] Dynamics Based Features For Graph Classification
该论文提出了一种基于特征的新型图分类方法,利用网络中随机游走者的动态特性,在多个时间尺度上提取广义同配性特征。通过计算节点属性(结构特征或外部标签)随时间的协方差,该方法在基准数据集上实现了最先进水平的准确率,包括一个新的人类大脑连接组数据集,在该数据集中使用边权重和独热编码的节点标签时达到了81.30%的准确率。
Numerous social, medical, engineering and biological challenges can be framed as graph-based learning tasks. Here, we propose a new feature based approach to network classification. We show how dynamics on a network can be useful to reveal patterns about the organization of the components of the underlying graph where the process takes place. We define generalized assortativities on networks and use them as generalized features across multiple time scales. These features turn out to be suitable signatures for discriminating between different classes of networks. Our method is evaluated empirically on established network benchmarks. We also introduce a new dataset of human brain networks (connectomes) and use it to evaluate our method. Results reveal that our dynamics based features are competitive and often outperform state of the art accuracies.
研究动机与目标
- 开发一种可扩展、高效且通用的基于特征的图分类方法,避免图核方法带来的计算负担。
- 利用网络动态特性——特别是随机游走过程中节点属性的时间相关性——作为结构和语义信息的来源。
- 在多样化的数据集上评估该方法,包括一个基于MRI数据构建的新的人类大脑连接组数据集。
- 证明仅基于最小结构特征和可用的节点元数据所计算的广义同配性,即可在无需深度学习或复杂核计算的情况下实现高分类准确率。
提出的方法
- 该方法将广义同配性定义为随机游走者在多个时间步长内观察到的节点属性(例如,度数、PageRank、原子类型)的时间平均协方差。
- 在一系列时间尺度上计算这些特征,以捕捉网络中的多尺度结构模式。
- 节点属性包括内在的结构特征和外部标签(例如,蛋白质类型、脑网络中的ROI),在相关时通过独热编码表示。
- 采用线性C-SVM分类器对提取的特征向量执行二分类和多分类图分类。
- 将边权重整合到随机游走转移矩阵中,以保留拓扑和加权连通性信息。
- 该方法应用于生物信息学、社交网络和神经科学数据集,包括一个基于MRI数据构建的新84节点连接组数据集(204个人脑,91名男性,113名女性)。
实验结果
研究问题
- RQ1基于随机游走提取的动力学特征是否能在多个时间尺度上揭示网络结构中的判别性模式?
- RQ2节点属性的广义同配性与最先进图核方法及基于特征的方法相比,在图分类准确率上表现如何?
- RQ3当所有图共享相同顶点标签时,该方法能否有效利用节点元数据(如原子类型、ROI标签)而避免冗余?
- RQ4在真实世界网络(如脑连接组)中,引入边权重是否能提升分类性能?
- RQ5该方法能否在包括社交网络、生化网络和神经影像网络在内的多种图类型上实现良好泛化?
主要发现
- 所提出的基于动态特性的特征(DyF)在新的人类大脑连接组数据集上达到81.30% ± 2.07的准确率,优于所有对比方法,包括Weisfeiler-Lehman、最短路径和深度图核方法。
- 即使不使用节点标签(DyF-nolab),该方法仍达到67.75% ± 1.25的准确率,超过同一数据集上的所有图核和基于特征的基线方法。
- 引入边权重(DyF-nolab + w)使准确率提升至75.05% ± 0.98,证明了加权网络结构在特征提取中的价值。
- 使用独热编码的节点标签(DyF + w)达到最高准确率81.30% ± 2.07,表明当元数据可用时,该方法能有效利用其信息。
- 在标准生物信息学和社交网络基准数据集上,该方法在无需深度学习或复杂核计算的情况下,仍实现了与最先进方法相当或更优的准确率。
- 该方法计算效率高且可扩展,避免了传统图核方法的二次方内存开销,同时保持高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。