[论文解读] AceKG: A Large-scale Knowledge Graph for Academic Data Mining
AceKG 是一个大规模、异构的知识图谱,基于一致的本体论包含 31.3 亿个学术三元组,整合了论文、作者、研究领域、会议/期刊及机构等实体。它通过实体对齐、基于规则的推理以及知识嵌入模型的基准测试,支持高级学术数据挖掘,其中 metapath2vec 在链接预测和学者聚类任务中达到最先进性能。
Most existing knowledge graphs (KGs) in academic domains suffer from problems of insufficient multi-relational information, name ambiguity and improper data format for large-scale machine processing. In this paper, we present AceKG, a new large-scale KG in academic domain. AceKG not only provides clean academic information, but also offers a large-scale benchmark dataset for researchers to conduct challenging data mining projects including link prediction, community detection and scholar classification. Specifically, AceKG describes 3.13 billion triples of academic facts based on a consistent ontology, including necessary properties of papers, authors, fields of study, venues and institutes, as well as the relations among them. To enrich the proposed knowledge graph, we also perform entity alignment with existing databases and rule-based inference. Based on AceKG, we conduct experiments of three typical academic data mining tasks and evaluate several state-of- the-art knowledge embedding and network representation learning approaches on the benchmark datasets built from AceKG. Finally, we discuss several promising research directions that benefit from AceKG.
研究动机与目标
- 为解决现有学术知识图谱在多关系数据不足、姓名歧义和机器可处理性差等方面的局限性。
- 构建一个大规模、结构化且语义一致的知识图谱,涵盖多样化的学术实体及其关系。
- 提供一个基准数据集,用于评估学术数据挖掘中知识嵌入与网络表征学习方法的性能。
- 支持合作预测、作者消歧和新兴学术明星识别等高级研究任务。
- 通过将实体与 DBLP、ACM 和 IEEE 等外部数据库对齐,提升数据集成能力。
提出的方法
- AceKG 基于标准化本体论,利用 31.3 亿个 SPO(主体-谓词-客体)三元组构建异构知识图谱,其五个核心类为:论文、作者、研究领域、会议/期刊和机构。
- 每个实体均被分配唯一 URI,以解决姓名歧义问题,并确保图谱中实体的无歧义标识。
- 通过与外部知识库(如 DBLP、ACM、IEEE)对齐,实现实体对齐,将 AceKG 中的实体链接至现有学术数据库。
- 应用基于规则的推理,为图谱补充隐含关系,提升覆盖范围与一致性。
- 使用 DeepWalk、LINE、PTE 和 metapath2vec 等模型学习知识图谱嵌入,结合异构采样与跳字模型训练方法。
- 在三个核心任务上开展实验:链接预测、社区发现和学者分类,采用 MRR、Hits@10 和 NMI 等标准评估指标。
实验结果
研究问题
- RQ1最先进知识嵌入模型在大规模学术知识图谱上的链接预测与社区发现任务中表现如何?
- RQ2AceKG 中的节点表征在多大程度上可提升学者分类与聚类性能?
- RQ3多关系结构与实体对齐的引入如何提升学术知识图谱的质量与实用性?
- RQ4AceKG 是否可作为学术数据挖掘中新算法评估的可靠基准?
- RQ5大规模、结构化的学术知识图谱(如 AceKG)能开启哪些最具前景的研究方向?
主要发现
- 在链接预测任务中,metapath2vec 达到最高的 MRR(0.831)与 Hits@10(0.971),优于 DeepWalk、LINE 和 PTE。
- 在学者分类任务中,metapath2vec 在 Google 标注数据集上取得 0.836 的 Micro-F1,在 FOS 标注数据集上取得 0.427 的 Micro-F1,表明其在多领域学者识别任务中表现优异。
- FOS 标注数据集与 Google 标注数据集之间的模型性能差距凸显了数据分布的影响,Google 标注数据因包含顶级会议/期刊论文而表现更优。
- 在学者聚类任务中,metapath2vec 取得最高的 NMI 分数(0.836),证明其能有效捕捉学术网络中复杂的多关系模式。
- 经济学等领域的 Micro-F1 与 Macro-F1 之间显著下降,表明类别不平衡问题严重,影响了聚类性能。
- AceKG 通过增强的节点表征与图结构,开启了合作预测、作者消歧和新兴学术明星识别等全新研究方向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。