Skip to main content
QUICK REVIEW

[论文解读] UniK-QA: Unified Representations of Structured and Unstructured Knowledge for Open-Domain Question Answering

Barlas Oğuz, Xilun Chen|arXiv (Cornell University)|Dec 29, 2020
Topic Modeling被引用 15
一句话总结

UniK-QA 通过将结构化知识(例如知识库、表格、列表)转换为文本形式,并通过单一检索-阅读架构处理所有来源,提出了一种用于开放域问答的统一框架。该方法在 NaturalQuestions 上取得 +3.5 EM 的性能提升,在 WebQuestions 上取得 +2.6 EM 的性能提升,同时相比先前基于图的方法,KBQA 性能提升 11%。

ABSTRACT

We study open-domain question answering with structured, unstructured and semi-structured knowledge sources, including text, tables, lists and knowledge bases. Departing from prior work, we propose a unifying approach that homogenizes all sources by reducing them to text and applies the retriever-reader model which has so far been limited to text sources only. Our approach greatly improves the results on knowledge-base QA tasks by 11 points, compared to latest graph-based methods. More importantly, we demonstrate that our unified knowledge (UniK-QA) model is a simple and yet effective way to combine heterogeneous sources of knowledge, advancing the state-of-the-art results on two popular question answering benchmarks, NaturalQuestions and WebQuestions, by 3.5 and 2.6 points, respectively. The code of UniK-QA is available at: https://github.com/facebookresearch/UniK-QA.

研究动机与目标

  • 为解决将异构知识源(文本、表格、列表和知识库)整合到单一统一问答系统中的挑战。
  • 克服现有 KBQA 和 TextQA 系统孤立运行的局限性,这些系统在多源推理任务中表现不佳。
  • 证明统一的、基于文本的检索-阅读框架可超越专用的基于图的或混合架构,在开放域问答任务中表现更优。
  • 实现多种知识源的简单、可扩展集成,无需特定模式设计或复杂多模块流水线。

提出的方法

  • 所有结构化知识源(知识库关系、表格、列表)均被线性化为自然语言文本段落。
  • 在包含文本、列表、表格和 KB 关系的统一语料库上微调密集段落检索器(DPR),以检索相关段落。
  • 训练阅读模型(FiD 搭载 T5-large)从 top-k 检索段落中生成答案,将所有输入统一视为文本处理。
  • 系统采用可配置的 KB 段落配额机制,按问题分配 KB 段落数量,以平衡召回率与性能,该参数在开发集上进行调优。
  • 知识库关系使用其文本表面形式表示(例如,“born in” 而非符号化关系),从而支持与标准 NLP 模型端到端联合训练。
  • 来自不同来源的段落被交错排列并由阅读模型联合处理,实现对异构数据类型的联合推理。

实验结果

研究问题

  • RQ1统一的基于文本的检索-阅读框架能否有效处理开放域问答中的结构化、非结构化及半结构化知识源?
  • RQ2将结构化知识扁平化为文本是否能相比专用的基于图的方法,在 KBQA 基准上提升性能?
  • RQ3在标准开放域问答基准上,表格、列表和知识库的集成如何影响检索与阅读性能?
  • RQ4为实现最大性能增益,应在上下文中包含多少比例的 KB 段落为最优?
  • RQ5单一、同质化的模型能否在多源问答任务中超越多模块或异构架构系统?

主要发现

  • 与先前最先进方法相比,UniK-QA 在 NaturalQuestions 基准上实现了 3.5 的 EM 提升。
  • 在 WebQuestions 基准上,模型性能提升 2.6 EM 点,创下新的 SOTA 结果。
  • 该方法在 WebQSP 数据集上将 KBQA 的精确匹配性能提升 11%,超越了先前基于图的方法。
  • 模型表明,将 KB 关系线性化为文本可有效利用密集检索与阅读模型,即使在结构化查询场景下亦然。
  • 最优 KB 段落配额在不同数据集和 KB 来源间保持相对稳定,其中 WebQuestions 最受益于 KB 集成(最多可从 KB 获取 40% 的上下文段落)。
  • 统一框架成功将 Wikipedia 文本、表格、列表以及两个知识库(Freebase 和 Wikidata)整合为单一、可扩展的问答系统,且无需进行特定模式的修改。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。