Skip to main content
QUICK REVIEW

[论文解读] TIARA: Multi-grained Retrieval for Robust Question Answering over Large Knowledge Bases

Yiheng Shu, Zhiwei Yu|arXiv (Cornell University)|Oct 24, 2022
Topic Modeling被引用 9
一句话总结

TIARA 提出了一种多粒度检索增强框架,用于知识库问答(KBQA),通过检索实体、示例性逻辑形式和模式项来增强预训练语言模型(PLMs),从而提升语义对齐性和句法正确性。该方法在 GrailQA 和 WebQuestionsSP 上均达到最先进性能,在 GrailQA 上零样本泛化能力提升 4.7 F1 分,优于先前方法 4.1 F1 分。

ABSTRACT

Pre-trained language models (PLMs) have shown their effectiveness in multiple scenarios. However, KBQA remains challenging, especially regarding coverage and generalization settings. This is due to two main factors: i) understanding the semantics of both questions and relevant knowledge from the KB; ii) generating executable logical forms with both semantic and syntactic correctness. In this paper, we present a new KBQA model, TIARA, which addresses those issues by applying multi-grained retrieval to help the PLM focus on the most relevant KB contexts, viz., entities, exemplary logical forms, and schema items. Moreover, constrained decoding is used to control the output space and reduce generation errors. Experiments over important benchmarks demonstrate the effectiveness of our approach. TIARA outperforms previous SOTA, including those using PLMs or oracle entity annotations, by at least 4.1 and 1.1 F1 points on GrailQA and WebQuestionsSP, respectively.

研究动机与目标

  • 解决由于大规模、多样化知识库带来的 KBQA 零样本和组合泛化挑战。
  • 克服现有基于 PLM 的 KBQA 系统依赖独立同分布(i.i.d.)假设、在未见实体或关系上泛化能力差的局限性。
  • 通过整合结构化 KB 上下文中的语义与句法约束,提升逻辑形式生成的鲁棒性与正确性。
  • 通过结合实体链接、示例性逻辑形式检索与模式项检索,为基于 PLM 的 KBQA 提供更丰富的上下文监督。
  • 通过约束解码减少逻辑形式生成错误,确保输出符合 KB 模式。

提出的方法

  • 采用多粒度检索,检索三类 KB 上下文:通过提及检测与链接的实体、来自相似问题的示例性逻辑形式(ELFs),以及相关的模式项(类与关系)。
  • 通过改进的提及检测方法增强实体检索,提升零样本泛化能力,尤其针对模糊或罕见提及。
  • 采用示例检索方法,提供逻辑形式的结构与语义模式,提升 PLM 的语义对齐性并减少句法错误。
  • 引入灵活的模式检索机制,不限于两跳关系或以实体为中心的查询,实现更广泛的语义覆盖。
  • 使用基于 KB 模式的前缀树进行约束解码,限制输出空间,防止生成不存在的模式项或非法操作符。
  • 将所有检索到的上下文整合到基于 PLM 的生成器中,生成基于 KB 的可执行逻辑形式。

实验结果

研究问题

  • RQ1多粒度检索实体、示例性逻辑形式与模式项是否能提升基于 PLM 的 KBQA 在零样本与组合设定下的鲁棒性?
  • RQ2结合多种检索粒度在多大程度上提升了逻辑形式生成的语义对齐性与句法正确性?
  • RQ3约束解码在多大程度上减少了如不存在的模式项或非法操作符等生成错误?
  • RQ4模式项检索在多跳或函数丰富的查询中,能否弥补逻辑形式枚举的局限性?
  • RQ5在分布内与零样本评估设置下,TIARA 的性能与 SOTA 方法相比如何?

主要发现

  • TIARA 在 GrailQA 上相比先前 SOTA 方法提升 4.1 F1 分,零样本泛化能力提升 4.7 F1 分,展现出强大的鲁棒性。
  • 在 WebQuestionsSP 上,TIARA 比先前 SOTA 方法高出 1.1 F1 分,证实其在多样化基准上的有效性。
  • 实体检索错误占失败原因的 46%,凸显提及歧义与检测挑战是零样本场景下的主要瓶颈。
  • 句法错误(26%)主要源于稀有操作符(如 ARGMIN、ARGMAX)与复杂多约束查询,表明 PLM 泛化能力存在局限。
  • 语义错误(12%)在零样本情形下最为普遍(占此类错误的 83.3%),表明在正确模式项未见时,模式项选择错误是主要挑战。
  • 约束解码显著减少了无效输出——案例研究表明,当正确模式项存在时,可有效防止生成如 'resistance_unit' 等不存在的模式项。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。