Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Meta-path Reduction on Heterogeneous Information Networks

Xiaokai Wei, Zhiwei Liu|arXiv (Cornell University)|Oct 30, 2018
Neural Networks and Reservoir Computing被引用 4
一句话总结

该论文提出SPMR,一种用于异质信息网络的无监督元路径约简方法,通过优化元路径之间的转移概率相似性来保留语义信息。该方法在真实数据集(如BlogCatalog和DBLP)上仅使用较少的元路径即实现了优越的聚类性能,优于完整元路径集合和随机选择的结果。

ABSTRACT

Heterogeneous Information Network (HIN) has attracted much attention due to its wide applicability in a variety of data mining tasks, especially for tasks with multi-typed objects. A potentially large number of meta-paths can be extracted from the heterogeneous networks, providing abundant semantic knowledge. Though a variety of meta-paths can be defined, too many meta-paths are redundant. Reduction on the number of meta-paths can enhance the effectiveness since some redundant meta-paths provide interferential linkage to the task. Moreover, the reduced meta-paths can reflect the characteristic of the heterogeneous network. Previous endeavors try to reduce the number of meta-paths under the guidance of supervision information. Nevertheless, supervised information is expensive and may not always be available. In this paper, we propose a novel algorithm, SPMR (Semantic Preserving Meta-path Reduction), to reduce a set of pre-defined meta-paths in an unsupervised setting. The proposed method is able to evaluate a set of meta-paths to maximally preserve the semantics of original meta-paths after reduction. Experimental results show that SPMR can select a succinct subset of meta-paths which can achieve comparable or even better performance with fewer meta-paths.

研究动机与目标

  • 为解决异质信息网络(HINs)中冗余和噪声元路径的问题,这些元路径会降低下游任务的性能。
  • 开发一种无监督的元路径约简方法,无需依赖昂贵的监督信号,即可保留原始HIN的语义结构。
  • 识别出一个简洁的元路径子集,以保持完整集合中所包含的关键连通性和语义关系。
  • 通过约简后的元路径集合揭示网络的内在特性,辅助人类对HIN结构的理解。

提出的方法

  • SPMR将元路径约简建模为一个优化问题,以保留不同元路径之间节点对的转移概率。
  • 通过在HIN上进行随机游走所生成的转移概率矩阵,对元路径之间的语义相似性进行建模。
  • 该方法采用投影拟牛顿优化技术,选择能够最好保留原始转移概率分布的最小元路径子集。
  • 目标函数在语义保留和元路径集合大小之间取得平衡,倾向于选择紧凑且信息丰富的子集。
  • 该方法为无监督方法,仅依赖网络结构,不依赖外部标签或反馈。
  • 通过下游聚类任务评估约简后元路径集合的质量,以验证语义保留的有效性。

实验结果

研究问题

  • RQ1无监督方法能否在有效保留语义含义的同时,显著减少异质信息网络中的元路径数量?
  • RQ2在使用约简后的元路径子集与使用全部元路径时,下游任务(如聚类)的性能表现有何差异?
  • RQ3通过选择一个最小且信息丰富的元路径子集,能够揭示网络的哪些内在特性?
  • RQ4少量元路径在多大程度上能够实现与使用全部元路径相当或更优的性能?

主要发现

  • 在BlogCatalog数据集上,仅使用SPMR选出的3个元路径,聚类准确率相比使用全部15个元路径提升了42.4%。
  • 在BlogCatalog上,SPMR使用3个元路径实现了0.3777的NMI聚类分数,优于使用全部路径的基线分数0.1861。
  • 在DBLP数据集上,SPMR使用3个元路径使NMI提升了17.0%(相比完整集合),并相比随机选择提升了77.3%。
  • DBLP中排名第一的元路径“Author - Paper - Author - Paper - Term - Paper - Author”保留了最多的语义信息,优于更长且冗余的变体。
  • 在BlogCatalog中,涉及用户和标签关系的元路径被优先选择,表明其在网络结构中的核心地位。
  • “Blog - User - User - User - Blog”元路径的剔除表明,在BlogCatalog中朋友-朋友关系稀疏且缺乏信息量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。