[论文解读] WikiDataSets: Standardized sub-graphs from Wikidata
本文介绍了 WikiDataSets,这是一个从 Wik基数据中提取的标准化、主题特定的子图集合,可实现知识图谱处理与关系学习的可复现研究。通过一个可重用的 Python 包,作者通过递归收集子类并筛选相关事实,生成了五个数据集——动物、公司、国家、电影和人类,评估结果表明在人类数据集上使用 TransH 和 ANALOGY 模型进行链接预测时表现优异。
Developing new ideas and algorithms in the fields of graph processing and relational learning requires public datasets. While Wikidata is the largest open source knowledge graph, involving more than fifty million entities, it is larger than needed in many cases and even too large to be processed easily. Still, it is a goldmine of relevant facts and relations. Using this knowledge graph is time consuming and prone to task specific tuning which can affect reproducibility of results. Providing a unified framework to extract topic-specific subgraphs solves this problem and allows researchers to evaluate algorithms on common datasets. This paper presents various topic-specific subgraphs of Wikidata along with the generic Python code used to extract them. These datasets can help develop new methods of knowledge graph processing and relational learning.
研究动机与目标
- 解决现有 Wikidata 数据在关系学习和图算法评估中存在的一致性差、规模大且难以处理的问题。
- 减少现有基准工作流中因临时数据集整理导致的可复现性问题。
- 提供一个统一的开源框架,用于从 Wikidata 中提取和使用主题特定的子图。
- 使研究人员能够基于一致、文档齐全且公开可用的数据集评估新算法。
提出的方法
- WikiDataSets Python 包通过识别属于某一主题或其子类的所有 Wikidata 实体(例如,人类的 Q5)来提取子图。
- 它处理完整的 Wikidata 转储文件(latest-all.json.bz2),仅保留涉及选定节点的事实,同时保留标记的关系和属性。
- 该流程包括三个主要步骤:检索主题的子类、基于选定实体从转储中筛选事实,以及构建结构化输出文件。
- 输出包含每个数据集五个文件:edges.txt(三元组)、attributes.txt(外部事实)、entities.txt(标签和 Wikidata ID)、nodes.txt(实体子集)以及 relations.txt(关系元数据)。
- 该框架支持英文标签收集,并确保所有图均为完全标记的知识图。
- 代码为开源,可在 PyPI 和项目官网获取,可供重用和扩展。
实验结果
研究问题
- RQ1能否自动生成来自 Wikidata 的标准化、主题特定子图,以提升知识图谱研究的可复现性?
- RQ2现有知识图谱嵌入模型在经过整理的 Wikidata 子图上的表现,与传统基准相比如何?
- RQ3Wikidata 子图的结构和关系特性在多大程度上支持有意义的社区检测和语义分析?
- RQ4一个通用的、可重用的框架能否简化从大规模开放知识库(如 Wikidata)中提取特定领域知识图的过程?
主要发现
- 经过筛选的‘人类’数据集(仅包含超过五个事实的实体)包含 238,376 个节点和 722,993 条边,构成一个高质量的知识图用于评估。
- 在筛选后的‘人类’数据集上,ANALOGY 模型实现了过滤后的 Hit@10 为 67.9,过滤后的平均排名为 10,147,优于 TransH 模型。
- TransH 模型实现了过滤后的 Hit@10 为 61.8,过滤后的平均排名为 15,027,表明其性能强劲但略低于 ANALOGY 模型。
- 在‘人类’数据集上使用 Louvain 算法进行社区检测,揭示了语义上一致的聚类,例如美国艺术家和越南政治领导人,通过 3D 力导向布局可视化。
- 各数据集中顶级边类型反映了领域特定的关系——例如,在‘人类’数据集中‘子女’、‘配偶’和‘父亲’占主导;而在‘公司’数据集中‘母公司的组织’和‘子公司’更为普遍。
- WikiDataSets 包成功自动化创建了具有一致性、标记完整且可重用的子图,所有数据集和代码均公开提供用于研究用途。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。