Skip to main content
QUICK REVIEW

[论文解读] KQA Pro: A Large Diagnostic Dataset for Complex Question Answering over Knowledge Base.

Jiaxin Shi, Shulin Cao|arXiv (Cornell University)|Jul 8, 2020
Topic Modeling参考文献 22被引用 12
一句话总结

KQA Pro 是一个大规模、多样化的知识库问答数据集,包含 120K 个复杂问答实例,通过递归模板生成并经众包方式实现改写,配套提供 SPARQL 查询和功能程序以建模推理过程。尽管最先进模型的准确率仅为 35.15%,但人类表现达到 97.5%,凸显在知识库问答的组合推理方面仍有巨大提升空间。

ABSTRACT

Complex question answering over knowledge base (Complex KBQA) is challenging because it requires the compositional reasoning capability. Existing benchmarks have three shortcomings that limit the development of Complex KBQA: 1) they only provide QA pairs without explicit reasoning processes; 2) questions are either generated by templates, leading to poor diversity, or on a small scale; and 3) they mostly only consider the relations among entities but not attributes. To this end, we introduce KQA Pro, a large-scale dataset for Complex KBQA. We generate questions, SPARQLs, and functional programs with recursive templates and then paraphrase the questions by crowdsourcing, giving rise to around 120K diverse instances. The SPARQLs and programs depict the reasoning processes in various manners, which can benefit a large spectrum of QA methods. We contribute a unified codebase and conduct extensive evaluations for baselines and state-of-the-arts: a blind GRU obtains 31.58\%, the best model achieves only 35.15\%, and humans top at 97.5\%, which offers great research potential to fill the gap.

研究动机与目标

  • 解决复杂知识库问答(KBQA)领域缺乏大规模、多样化且具备推理轨迹标注的数据集的问题。
  • 克服现有基准的局限性,包括缺乏显式推理过程、问题多样性不足以及对实体属性考虑有限。
  • 提供统一的代码库和全面的评估套件,以标准化并推动组合式 KBQA 研究的发展。
  • 支持开发能够处理多跳推理、属性推理以及知识库上复杂查询组合的模型。

提出的方法

  • 使用递归模板生成问题和 SPARQL 查询,以确保结构多样性与组合复杂性。
  • 通过众包方式对生成的问题进行改写,以提升语言多样性,同时保持语义和逻辑结构一致。
  • 构建显式表示每个问题推理路径的功能程序和 SPARQL 查询。
  • 通过在知识库模式和问题生成中引入属性,确保涵盖关系推理与基于属性的推理。
  • 设计统一的代码库,以支持在相同基准上对多种 KBQA 模型进行训练、评估与比较。
  • 将数据集结构化为每个问题包含多个推理轨迹(SPARQL 和功能程序),以提升模型可解释性与训练效果。

实验结果

研究问题

  • RQ1大规模、多样化且具备推理轨迹标注的数据集能否提升复杂 KBQA 模型的性能与泛化能力?
  • RQ2当前模型在复杂 KBQA 中多大程度上利用了组合推理与基于属性的查询?
  • RQ3问题的语言多样性在多大程度上影响模型在 KBQA 中的鲁棒性与泛化能力?
  • RQ4最先进模型与人类在复杂 KBQA 任务上的性能差距有多大?
  • RQ5将功能程序和 SPARQL 查询作为推理监督信号,能否显著提升模型学习效果与可解释性?

主要发现

  • KQA Pro 数据集包含约 120,000 个多样化、经人类改写的问答对,并带有显式的推理轨迹。
  • 盲测 GRU 基线模型准确率达到 31.58%,表明其在新基准上的基线性能。
  • 表现最佳的模型准确率仅为 35.15%,揭示其与人类水平性能之间存在显著差距。
  • 人类在该数据集上的表现达到 97.5%,表明复杂 KBQA 仍是极具挑战性的任务,存在巨大改进空间。
  • 将 SPARQL 和功能程序作为推理标注,可显著提升 KBQA 模型的可解释性与训练监督质量。
  • 数据集的多样性与推理轨迹支持多种问答方法,包括基于神经网络、符号推理及混合架构的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。