Skip to main content
QUICK REVIEW

[论文解读] Benchmarking the Combinatorial Generalizability of Complex Query Answering on Knowledge Graphs

Zihao Wang, Hang Yin|arXiv (Cornell University)|Sep 18, 2021
Advanced Graph Neural Networks参考文献 18被引用 4
一句话总结

本文提出EFO-1-QA,一个大规模基准数据集,包含301种复杂查询类型——是先前数据集的20倍——用于评估知识图谱上的复杂查询问答(CQA)中组合泛化能力。该研究提出了一套系统性框架,利用7种操作符系统和9种查询表示形式生成多样化的查询标准形式,揭示了增加训练查询多样性并不总能提升泛化性能,挑战了当前的训练范式。

ABSTRACT

Complex Query Answering (CQA) is an important reasoning task on knowledge graphs. Current CQA learning models have been shown to be able to generalize from atomic operators to more complex formulas, which can be regarded as the combinatorial generalizability. In this paper, we present EFO-1-QA, a new dataset to benchmark the combinatorial generalizability of CQA models by including 301 different queries types, which is 20 times larger than existing datasets. Besides, our work, for the first time, provides a benchmark to evaluate and analyze the impact of different operators and normal forms by using (a) 7 choices of the operator systems and (b) 9 forms of complex queries. Specifically, we provide the detailed study of the combinatorial generalizability of two commonly used operators, i.e., projection and intersection, and justify the impact of the forms of queries given the canonical choice of operators. Our code and data can provide an effective pipeline to benchmark CQA models.

研究动机与目标

  • 为解决知识图谱上复杂查询问答(CQA)中组合泛化能力评估缺乏全面基准的问题。
  • 提供一个可扩展、可扩展的框架,用于生成多样化的EFO-1查询类型、标准形式和训练数据。
  • 研究不同操作符系统和查询标准形式对模型泛化性能的影响。
  • 分析训练查询多样性对分布外泛化性能的影响。
  • 通过揭示训练类型增加时泛化性能呈现非单调提升,挑战关于数据扩增的既有假设。

提出的方法

  • 设计一个综合性框架,系统探索存在量词一阶逻辑查询(EFO-1)的组合空间。
  • 定义7种不同的操作符系统,包括投影、合取、析取、否定和集合差的组合。
  • 利用逻辑等价性将每个查询转换为最多9种不同的标准形式,以分析表示形式的影响。
  • 从三个知识图谱(Freebase、YAGO、NELL)中采样查询及其答案集,构建EFO-1-QA数据集。
  • 在不同标准形式和训练策略下,训练并评估多种CQA模型(如BetaE、LogicE、NewLook)。
  • 使用MRR、HIT@k和RA-Oracle等指标评估模型在未见查询类型上的泛化能力。

实验结果

研究问题

  • RQ1操作符系统的选择在多大程度上影响CQA模型在未见查询类型上的泛化性能?
  • RQ2同一逻辑查询的不同标准形式在多大程度上影响模型的泛化能力和性能?
  • RQ3增加训练查询类型数量是否总是能提升CQA在分布外的泛化能力?
  • RQ4不同的逻辑表示形式(如DNF + IU与DNF + IUD)在多大程度上影响模型学习与泛化?
  • RQ5查询结构复杂度(如链长度、操作符数量)在多大程度上影响模型泛化能力?

主要发现

  • EFO-1-QA数据集包含301种不同的查询类型,相比现有基准提升了20倍,且显著更具挑战性。
  • 在多样化查询类型上进行训练的模型并不总能获得更好的泛化性能;性能增益在训练多样性增加时趋于饱和甚至下降,表明存在非单调关系。
  • 在所有模型和知识图谱中,DNF + IU标准形式在MRR和HIT@k指标上始终优于其他形式。
  • 使用集合差(通过交集与否定组合实现)替代显式否定操作符,相比将否定视为原语操作符,能带来更好的泛化性能。
  • RA-Oracle指标显示,基于EFO-1-QA训练的模型在泛化能力上优于基于先前数据集训练的模型,证实了本基准的更高难度和代表性。
  • 该框架支持对标准形式和操作符系统的系统性消融分析,揭示了查询表示对模型学习与泛化具有显著影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。