Skip to main content
QUICK REVIEW

[论文解读] Distributed Representation of Subgraphs

Bijaya Adhikari, Yao Zhang|arXiv (Cornell University)|Feb 22, 2017
Advanced Graph Neural Networks参考文献 21被引用 6
一句话总结

本文提出Sub2Vec,一种无监督、可扩展的算法,通过受段落向量框架启发的局部邻近性保持机制,学习任意子图的分布式表示。其在社区检测任务中性能优于节点嵌入高达4倍,并在多种真实网络中的链接预测任务中表现出色。

ABSTRACT

Network embeddings have become very popular in learning effective feature representations of networks. Motivated by the recent successes of embeddings in natural language processing, researchers have tried to find network embeddings in order to exploit machine learning algorithms for mining tasks like node classification and edge prediction. However, most of the work focuses on finding distributed representations of nodes, which are inherently ill-suited to tasks such as community detection which are intuitively dependent on subgraphs. Here, we propose sub2vec, an unsupervised scalable algorithm to learn feature representations of arbitrary subgraphs. We provide means to characterize similarties between subgraphs and provide theoretical analysis of sub2vec and demonstrate that it preserves the so-called local proximity. We also highlight the usability of sub2vec by leveraging it for network mining tasks, like community detection. We show that sub2vec gets significant gains over state-of-the-art methods and node-embedding methods. In particular, sub2vec offers an approach to generate a richer vocabulary of features of subgraphs to support representation and reasoning.

研究动机与目标

  • 填补子图分布式表示学习的空白,因为子图在社区检测等任务中至关重要,但相较于节点级嵌入仍研究不足。
  • 开发一种可扩展的方法,为任意子图生成低维向量表示,同时保留其结构相似性。
  • 利用语言建模工具提供子图嵌入的理论依据,类比于word2vec和PV-DBOW/PV-DM。
  • 展示子图嵌入在下游网络挖掘任务(如社区检测和链接预测)中的实用性。

提出的方法

  • 将自然语言处理中的段落向量(PV-DBOW和PV-DM)框架适配至子图嵌入,将每个子图视为一个'段落'。
  • 将局部邻近性定义为基于共享节点、边和路径的子图间结构相似性的度量。
  • 使用负采样和随机梯度下降优化每个子图周围中间邻域的观测似然。
  • 学习每个子图的d维嵌入,使得局部邻近性高的子图在向量空间中被映射得更接近。
  • 通过最大化每个子图邻域中常见子结构的观测概率,来保持局部邻近性。
  • 通过一种可推广的框架支持有向和无向图,超越节点级嵌入的局限。

实验结果

研究问题

  • RQ1我们能否学习到有意义的、低维的、保留结构相似性的任意子图分布式表示?
  • RQ2如何定义并形式化子图之间的局部邻近性,以指导嵌入过程?
  • RQ3子图嵌入能否在基于子图的网络挖掘任务(如社区检测)中优于节点级嵌入?
  • RQ4与现有方法相比,Sub2Vec在大规模、多样化的现实世界网络中的可扩展性如何?
  • RQ5基于局部邻近性的嵌入在哪些情况下会失效?采用其他邻近性度量(如位置性或结构性度量)能否提升性能?

主要发现

  • 与SOTA节点嵌入方法(如Node2Vec)相比,Sub2Vec在社区检测准确率上最高提升达4倍。
  • 在Facebook网络中,Sub2Vec(使用PV-DM)在40%边被移除时达到0.78的平均精度,优于Node2Vec(0.45)和其他基线方法。
  • 在链接预测任务中,Sub2Vec在密集网络中始终优于节点嵌入,尤其在较低边移除率(P = 40–50%)时表现更优。
  • 当边移除率提高至60%时,Sub2Vec性能下降,因网络稀疏化导致子图重叠减少,局部邻近性减弱。
  • Sub2Vec提供了更丰富的子图特征词汇,支持超越节点级抽象的推理与表示学习。
  • 理论分析证实,Sub2Vec保持了局部邻近性,其原理与语言建模及word2vec一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。