Skip to main content
QUICK REVIEW

[论文解读] HybridQA: A Dataset of Multi-Hop Question Answering over Tabular and Textual Data

Wenhu Chen, Hanwen Zha|arXiv (Cornell University)|Apr 15, 2020
Topic Modeling参考文献 26被引用 12
一句话总结

HybridQA 是一个大规模、众包构建的问答数据集,要求在维基百科表格和关联的自由文本段落之间进行多跳推理。该数据集表明,结合两种模态的模型在精确匹配(EM)上超过40%,显著优于仅使用表格或仅使用文本的基线模型(低于20% EM),凸显了在复杂问答任务中整合异构信息的必要性。

ABSTRACT

Existing question answering datasets focus on dealing with homogeneous information, based either only on text or KB/Table information alone. However, as human knowledge is distributed over heterogeneous forms, using homogeneous information alone might lead to severe coverage problems. To fill in the gap, we present HybridQA https://github.com/wenhuchen/HybridQA, a new large-scale question-answering dataset that requires reasoning on heterogeneous information. Each question is aligned with a Wikipedia table and multiple free-form corpora linked with the entities in the table. The questions are designed to aggregate both tabular information and text information, i.e., lack of either form would render the question unanswerable. We test with three different models: 1) a table-only model. 2) text-only model. 3) a hybrid model that combines heterogeneous information to find the answer. The experimental results show that the EM scores obtained by two baselines are below 20\%, while the hybrid model can achieve an EM over 40\%. This gap suggests the necessity to aggregate heterogeneous information in HybridQA. However, the hybrid model's score is still far behind human performance. Hence, HybridQA can serve as a challenging benchmark to study question answering with heterogeneous information.

研究动机与目标

  • 解决现有问答数据集依赖同质信息(仅文本或仅表格)的局限性,这种依赖无法反映现实世界的知识分布。
  • 构建一个真实场景的问答基准,要求从结构化表格和非结构化文本段落中整合证据来回答问题。
  • 通过展示仅使用同质数据的模型表现不佳,证明在异构数据源之间进行多跳推理的必要性。
  • 提供一个具有挑战性且大规模的数据集,以推动混合问答系统的研究。
  • 建立一个强大的基线模型(hybrider),结合表格和文本推理,揭示模块化架构中的误差传播问题。

提出的方法

  • 通过众包收集70,000个问答对,使用与超链接文本段落关联的维基百科表格。
  • 设计的问题必须仅靠表格或仅靠文本无法回答,确保依赖于两种数据形式的协同。
  • 实现三种模型:仅表格模型、仅文本段落模型,以及一个混合模型(hybrider),该模型在两种模态之间执行多跳推理。
  • 在hybrider中采用模块化流水线:(1) 表格推理以识别相关单元格,(2) 基于表格实体进行段落检索,(3) 阅读理解以提取答案片段。
  • 为表格推理和阅读理解使用基于BERT的模型,并采用温度缩放(τ=0.8)进行置信度过滤。
  • 通过将推理过程分解为阶段(表格跳跃、段落检索、阅读理解、答案预测)来分析错误类型。

实验结果

研究问题

  • RQ1在仅使用同质数据(仅文本或仅表格)训练的模型,能否有效回答需要同时依赖表格和文本证据的问题?
  • RQ2在复杂、多跳问答任务中,结合异构信息能在多大程度上提升性能?
  • RQ3混合问答系统中的主导错误模式是什么?误差传播如何影响端到端性能?
  • RQ4模块化混合模型在需要跨异构源进行多跳推理的数据集上的表现,与人类表现相比如何?
  • RQ5同质模型与混合模型之间的性能差距是否具有统计显著性?这是否验证了异构信息整合的必要性?

主要发现

  • 仅表格模型和仅文本段落模型的EM得分均低于20%,表明仅依赖单一数据模态存在严重局限性。
  • 混合模型(hybrider)的EM得分超过40%,证明整合表格和文本证据可带来显著性能提升。
  • 错误分析显示,阅读理解步骤是最易出错的,错误率高达61.9%,是整体失败的主要原因。
  • 误差级联现象普遍:各阶段准确率的乘积(87.4% × 87.9% × 89.2% × 61.9%)与整体模型准确率(约42%)高度吻合,证实误差传播是关键挑战。
  • 混合模型的性能仍远低于人类表现,表明HybridQA是未来研究的具有挑战性的基准。
  • 通过仔细的注释校准,该数据集设计防止了单跳或同质模型的利用,确保每道问题都必须依赖两种数据形式才能解答。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。