[论文解读] Improving Textual Network Learning with Variational Homophilic Embeddings
本文提出变分同质嵌入(VHE),一种完全生成式的网络嵌入模型,通过变分自编码器联合建模文本语义与网络拓扑结构,并引入一种新颖的同质性先验,以促使相连顶点获得相似的嵌入表示。VHE在真实世界网络的链接预测与顶点分类任务中均达到最先进性能,展现出对未见顶点的更好泛化能力以及对缺失边的鲁棒性。
The performance of many network learning applications crucially hinges on the success of network embedding algorithms, which aim to encode rich network information into low-dimensional vertex-based vector representations. This paper considers a novel variational formulation of network embeddings, with special focus on textual networks. Different from most existing methods that optimize a discriminative objective, we introduce Variational Homophilic Embedding (VHE), a fully generative model that learns network embeddings by modeling the semantic (textual) information with a variational autoencoder, while accounting for the structural (topology) information through a novel homophilic prior design. Homophilic vertex embeddings encourage similar embedding vectors for related (connected) vertices. The proposed VHE promises better generalization for downstream tasks, robustness to incomplete observations, and the ability to generalize to unseen vertices. Extensive experiments on real-world networks, for multiple tasks, demonstrate that the proposed method consistently achieves superior performance relative to competing state-of-the-art approaches.
研究动机与目标
- 解决判别式网络嵌入模型在牺牲泛化能力与鲁棒性的前提下过度追求链接预测准确率的局限性。
- 开发一种完全生成式方法,利用变分贝叶斯框架联合建模顶点属性(如文本)与网络拓扑结构。
- 将同质性(即相似顶点更可能相连)引入潜在空间的先验分布,以提升嵌入质量。
- 实现对未见顶点的泛化能力以及对不完整或缺失边观测的鲁棒性。
- 通过引入短语到词的对齐机制,增强文本网络中的表示学习,实现更优的局部语义建模。
提出的方法
- VHE将网络嵌入建模为顶点对上的生成过程,利用变分自编码器联合建模文本与连通性的联合似然。
- 提出一种新颖的同质性先验,以鼓励相连顶点在潜在空间中具有相似的表示,利用结构信息对嵌入空间进行正则化。
- 模型采用短语到词的对齐机制,以捕捉文本中的局部语义依赖,提升文本嵌入质量。
- 编码器为每个顶点生成语义嵌入与基于结构的嵌入,后者通过同质性先验受网络拓扑信息影响。
- 通过潜在空间中的随机丢弃实现不确定性估计,提升对缺失边的鲁棒性及对未见顶点的泛化能力。
- 通过最大化数据似然的下界(ELBO)端到端训练模型,平衡文本与结构的重建性能。
实验结果
研究问题
- RQ1是否一种完全生成式模型,能够联合建模文本与网络结构,在网络表示学习中超越判别式基线?
- RQ2引入同质性先验(即鼓励相连顶点具有相似嵌入)对模型泛化能力与鲁棒性有何影响?
- RQ3当训练数据中存在缺失边时,该模型在未见顶点上的泛化能力能达到何种程度?
- RQ4短语到词的对齐机制在捕捉文本网络数据中的局部语义结构方面有多有效?
- RQ5通过丢弃法进行不确定性估计对不完整观测下的链接预测性能有何影响?
主要发现
- VHE在多个真实世界网络(包括Cora、PubMed和Zhihu)的链接预测任务中持续优于最先进方法,AUC得分超过所有对比模型。
- 在Cora数据集上,VHE在95%训练边条件下达到0.928的AUC,即使在部分监督下也表现出强劲性能。
- 在未见顶点上的测试中,VHE在仅观察到15%边的情况下仍保持高性能(AUC ≈ 0.89),优于判别式模型。
- 消融实验表明,移除结构嵌入会使Cora和HepTh数据集的AUC下降约2个百分点,表明其在捕捉结构模式中的重要性。
- 敏感性分析显示,增加同质性因子λ可提升性能,最优结果出现在λ = 1.0,且在α = 1.0的丢弃率下模型仍保持鲁棒。
- 短语到词的对齐机制有助于提升语义建模,其在所有数据集的下游任务中均带来一致性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。