Skip to main content
QUICK REVIEW

[论文解读] FeTaQA: Free-form Table Question Answering

Linyong Nan, Chia-Chun Hsieh|arXiv (Cornell University)|Apr 1, 2021
Topic Modeling参考文献 45被引用 4
一句话总结

FeTaQA 引入了一个新的自由形式表格问答基准数据集,包含 10,000 个基于 Wikipedia 的 {问题, 表格, 自由形式答案, 支持单元格} 三元组,要求进行复杂推理并整合不连续的事实。该研究评估了流水线和端到端模型,结果表明即使最先进的模型在流畅性、正确性和忠实性方面仍表现不佳,凸显了该数据集对生成式表格问答系统的挑战性。

ABSTRACT

Existing table question answering datasets contain abundant factual questions that primarily evaluate the query and schema comprehension capability of a system, but they fail to include questions that require complex reasoning and integration of information due to the constraint of the associated short-form answers. To address these issues and to demonstrate the full challenge of table question answering, we introduce FeTaQA, a new dataset with 10K Wikipedia-based {table, question, free-form answer, supporting table cells} pairs. FeTaQA yields a more challenging table question answering setting because it requires generating free-form text answers after retrieval, inference, and integration of multiple discontinuous facts from a structured knowledge source. Unlike datasets of generative QA over text in which answers are prevalent with copies of short text spans from the source, answers in our dataset are human-generated explanations involving entities and their high-level relations. We provide two benchmark methods for the proposed task: a pipeline method based on semantic-parsing-based QA systems and an end-to-end method based on large pretrained text generation models, and show that FeTaQA poses a challenge for both methods.

研究动机与目标

  • 解决现有表格问答数据集局限于短格式答案、未能捕捉复杂推理与解释生成的问题。
  • 构建一个反映现实世界用户查询的数据集,要求从半结构化表格中整合多条事实及高层次关系。
  • 提供一个强调推理、连贯性与忠实性的生成式表格问答基准,而非简单的信息抽取。
  • 在具有挑战性的人工标注自由形式答案生成任务上,评估流水线与端到端模型的性能。
  • 证明当前模型在生成流畅、正确、充分且忠实的答案方面存在不足,表明需要改进模型架构与训练策略。

提出的方法

  • 通过从 Wikipedia 表格中收集 10,000 个问答对构建 FeTaQA,确保涵盖多样化主题,并采用包含未归一化文本、日期和数字的半结构化格式。
  • 设计需要检索多个不连续事实并推理实体关系的问题,生成由人类编写的解释性自由形式答案。
  • 实施一种流水线方法:使用 TAPAS 进行表格语义解析,随后通过序列到序列生成器进行表面实现。
  • 开发一种基于微调 T5 的端到端方法,在单一序列到序列框架中联合学习查询理解、表格推理与文本生成。
  • 使用人工评估衡量模型输出在流畅性、正确性、充分性与忠实性方面的表现,并与标准人类参考答案进行比较。
  • 结合自动指标与人工评估,验证标注质量与任务难度。

实验结果

研究问题

  • RQ1现有表格问答系统能否生成需要基于 Wikipedia 表格中多个不连续事实进行推理的自由形式、连贯且事实忠实的答案?
  • RQ2在生成复杂解释性答案的表格问答任务中,流水线与端到端方法的表现如何比较?
  • RQ3当前的大规模语言模型与语义解析系统在具有挑战性的人工标注表格问答基准上,为何在生成流畅、正确与充分答案方面表现不佳?
  • RQ4当前模型在从结构化知识源生成解释时,主要的失败模式是什么?
  • RQ5在正确性与忠实性方面,人工标注的自由形式答案与模型生成输出的质量相比如何?

主要发现

  • 端到端的基于 T5 的模型在所有人工评估维度上均优于流水线方法,分别达到 54.8% 的正确性、48.4% 的充分性与 50.4% 的忠实性,而流水线模型则为 25.4%、8.4% 与 23.6%。
  • 人工参考答案的正确性为 92.4%,忠实性为 95.6%,表明当前模型与人类水平之间存在巨大性能差距。
  • 流水线模型在正确性与充分性方面表现显著不足,表明在使用独立模块时内容选择与表面实现存在局限。
  • 模型输出与人工参考答案在流畅性与正确性方面的巨大差距,证实 FeTaQA 对当前表格问答系统构成了重大挑战。
  • 人工评估确认了数据集标注的高质量,参考答案的流畅性为 95.0%,充分性为 90.6%,验证了数据集的可靠性。
  • 结果表明,当前模型在从表格生成复杂、忠实解释方面仍缺乏足够的推理与整合能力,亟需新型模型架构与训练范式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。