Skip to main content
QUICK REVIEW

[论文解读] Shifu2: A Network Representation Learning Based Model for Advisor-advisee Relationship Mining

Jiaying Liu, Feng Xia|arXiv (Cornell University)|Aug 17, 2020
Advanced Graph Neural Networks参考文献 38被引用 10
一句话总结

Shifu2 是一种网络表示学习模型,通过联合编码节点和边特征,从科学合作网络中挖掘导师-学生关系。该模型在稳定性和准确性方面优于当前最先进方法,并利用学习到的表示从 MAG 语料库中生成大规模学术谱系数据集。

ABSTRACT

The advisor-advisee relationship represents direct knowledge heritage, and such relationship may not be readily available from academic libraries and search engines. This work aims to discover advisor-advisee relationships hidden behind scientific collaboration networks. For this purpose, we propose a novel model based on Network Representation Learning (NRL), namely Shifu2, which takes the collaboration network as input and the identified advisor-advisee relationship as output. In contrast to existing NRL models, Shifu2 considers not only the network structure but also the semantic information of nodes and edges. Shifu2 encodes nodes and edges into low-dimensional vectors respectively, both of which are then utilized to identify advisor-advisee relationships. Experimental results illustrate improved stability and effectiveness of the proposed model over state-of-the-art methods. In addition, we generate a large-scale academic genealogy dataset by taking advantage of Shifu2.

研究动机与目标

  • 自动发现未明确记录的科学合作网络中的隐藏导师-学生关系。
  • 解决识别导师关系时时间依赖性和动态合作模式的挑战。
  • 将结构信息和语义信息(节点和边属性)整合到统一的表示学习框架中。
  • 为研究应用生成大规模、高质量的学术谱系数据集。
  • 在现有方法基础上,提升导师-学生关系挖掘的稳定性和有效性。

提出的方法

  • Shifu2 采用双自编码器架构:节点自编码器基于出版历史、职业时长等学术属性学习节点表示。
  • 边自编码器用于从合作模式中学习边表示,包括时间上的合作频率和持续时间。
  • 通过二分类头联合优化节点和边表示,以预测导师-学生关系。
  • 通过分析不同时间窗口(如学者职业生涯的前 7 年)内的合作数据,引入时间感知特征。
  • 使用深度自编码器将节点和边特征嵌入低维向量,同时保留网络的局部和全局结构。
  • 该框架在 MAG 数据集上端到端训练,超参数在验证集上进行调优。

实验结果

研究问题

  • RQ1网络表示学习能否有效从学术网络的间接合作信号中识别导师-学生关系?
  • RQ2时间合作模式(如频率和持续时间)在多大程度上影响导师关系检测的准确性?
  • RQ3整合语义节点和边属性在多大程度上提升导师-学生关系挖掘的性能?
  • RQ4Shifu2 在不同学术领域中,与最先进方法相比,在稳定性和 F1 分数方面表现如何?
  • RQ5Shifu2 能否扩展到从现实学术数据中生成大规模学术谱系数据集?

主要发现

  • 与最先进方法相比,Shifu2 在真实科学合作网络上的所有指标(准确率、精确率、召回率和 F1 分数)均表现更优。
  • 当在学者职业生涯前 7 年的合作数据上进行训练时,边自编码器表现最佳,表明这是特征提取的最佳时间窗口。
  • 不同学科的表现存在差异,计算机科学领域表现出更集中的导师-学生合作模式,而化学领域则相对分散,反映出学科特有的动态特征。
  • 该模型在物理、计算机科学和经济学等多样化研究领域中均表现出强大的稳定性和泛化能力。
  • Shifu2 从 MAG 语料库成功生成了大规模学术谱系数据集,包含带有相关学术属性的导师-学生配对。
  • 所生成的数据集可支持下游应用,如导师推荐、学术表现评估和审稿人选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。