[论文解读] Unsupervised Deep Manifold Attributed Graph Embedding
本文提出了一种新型无监督框架——深度流形属性图嵌入(DMAGE),通过优化节点间测地线相似性(采用Bregman散度)来同时保留属性图中的结构与特征信息。该方法引入轻量级全连接聚合层以缓解过平滑问题,并采用图增强策略提升稳定性,在四个基准数据集上的节点聚类、链接预测和可视化任务中均实现了最先进性能。
Unsupervised attributed graph representation learning is challenging since both structural and feature information are required to be represented in the latent space. Existing methods concentrate on learning latent representation via reconstruction tasks, but cannot directly optimize representation and are prone to oversmoothing, thus limiting the applications on downstream tasks. To alleviate these issues, we propose a novel graph embedding framework named Deep Manifold Attributed Graph Embedding (DMAGE). A node-to-node geodesic similarity is proposed to compute the inter-node similarity between the data space and the latent space and then use Bergman divergence as loss function to minimize the difference between them. We then design a new network structure with fewer aggregation to alleviate the oversmoothing problem and incorporate graph structure augmentation to improve the representation's stability. Our proposed DMAGE surpasses state-of-the-art methods by a significant margin on three downstream tasks: unsupervised visualization, node clustering, and link prediction across four popular datasets.
研究动机与目标
- 解决基于重建的无监督图嵌入方法存在的任务依赖性与过平滑问题。
- 在不依赖自编码器解码器的前提下,将图结构与节点特征信息同时保留在低维潜在空间中。
- 通过新型网络设计(减少聚合层数量)缓解深层GCN架构中的过平滑问题。
- 通过训练过程中采用图结构增强策略,提升嵌入的稳定性。
- 在聚类、链接预测和可视化等下游任务中实现更好的泛化能力与性能表现。
提出的方法
- 提出一种节点间测地线相似性度量方法,通过图中最短路径捕捉结构与基于特征的关系。
- 采用可学习自由度的t-分布核函数建模邻域相似性,平衡类内与类间关系。
- 引入全连接聚合(FCA)层,通过限制深层网络中的聚合操作次数,减轻过平滑问题。
- 使用Bregman散度作为损失函数,最小化数据空间与潜在空间中测地线相似性之间的差异。
- 通过随机添加一跳边与丢弃二跳边的方式实施图结构增强,提升鲁棒性,同时不改变图的语义。
- 通过反向传播端到端优化潜在空间表示,避免使用特定任务的重建目标。
实验结果
研究问题
- RQ1基于相似性的框架是否能在无监督属性图嵌入中超越基于重建的方法?
- RQ2通过FCA减少聚合层数量,对表示质量有何影响?是否能有效缓解深层GCN中的过平滑问题?
- RQ3图结构增强在多大程度上提升了学习嵌入的稳定性与泛化能力?
- RQ4超参数ν_latent与Q_p如何影响局部与全局结构保持之间的平衡?
- RQ5所提方法是否能在无监督条件下于多样化下游任务中实现最先进性能?
主要发现
- DMAGE在节点聚类任务中达到最先进性能,在CORA上准确率达74.15%,CiteSeer上为69.70%,PubMed上为76.35%,Wiki上为51.51%。
- 移除图增强后性能显著下降,尤其在PubMed(71.33% vs. 76.35%)与Wiki(48.64% vs. 51.51%)上,证明其具有稳定作用。
- 移除FCA层后,CORA上聚类准确率降至73.89%,CiteSeer上降至68.37%,若全部替换为GCN层则出现完全崩溃,证实FCA在防止过平滑中的关键作用。
- 将软测地线相似性替换为基于硬边的连接后,CORA准确率降至65.32%,CiteSeer降至66.78%,PubMed降至65.00%,证明测地线相似性在捕捉间接关系方面的优越性。
- 超参数Q_p对性能有可测量但不过于敏感的影响,其最优区间使DMAGE在聚类任务中超越基线方法。
- 在t-分布核函数中增加ν_latent可减少节点拥挤,使非相似节点彼此远离,从而改善可视化中的聚类分离效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。