Skip to main content
QUICK REVIEW

[论文解读] More Than Reading Comprehension: A Survey on Datasets and Metrics of Textual Question Answering

Yang Bai, Daisy Zhe Wang|arXiv (Cornell University)|Sep 25, 2021
Topic Modeling参考文献 70被引用 9
一句话总结

本综述提供了一份全面的、以应用为导向的47个文本问答(QA)基准数据集的分类体系,将其划分为经典机器阅读理解(MRC)、新型机器阅读理解(MRC)、开放域问答(ODQA)和常识性问答。评估了8项关键指标,识别出数据集构建中的趋势,如真实用户问题收集和证据标注,并倡导未来在非维基百科领域、多答案评估以及统一指标方面的基准研究,以提升可解释性并推动模型在当前基准之外的泛化能力。

ABSTRACT

Textual Question Answering (QA) aims to provide precise answers to user's questions in natural language using unstructured data. One of the most popular approaches to this goal is machine reading comprehension(MRC). In recent years, many novel datasets and evaluation metrics based on classical MRC tasks have been proposed for broader textual QA tasks. In this paper, we survey 47 recent textual QA benchmark datasets and propose a new taxonomy from an application point of view. In addition, We summarize 8 evaluation metrics of textual QA tasks. Finally, we discuss current trends in constructing textual QA benchmarks and suggest directions for future work.

研究动机与目标

  • 为解决因多样化文本QA基准数量快速增长而引起的混淆,提出一种统一的、面向应用的分类体系。
  • 系统比较47个基准数据集在任务类型、构建方法和统计特性方面的异同。
  • 总结并分析文本QA中使用的8项评估指标,突出其在不同答案类型中的分布特征。
  • 识别当前数据集构建中的趋势,如真实用户问题的来源和证据标注。
  • 提出未来研究方向,包括非维基百科领域、多答案评估以及指标统一化。

提出的方法

  • 基于应用场景提出了一种新颖的文本QA任务分类体系,区分经典MRC、四种新型MRC类型(对话式、多跳、长文本、跨语言)、ODQA和常识性问答。
  • 审查了31个MRC数据集(18个经典,13个新型MRC)、11个ODQA数据集和5个常识性QA数据集,提供详细统计数据和构建方法。
  • 总结了8项评估指标,包括精确匹配、F1、BLEU、ROUGE、BERT-score、BLEURT和IoU,附带公式和分布分析。
  • 通过系统比较问题收集方式、答案类型(跨度型 vs. 自由形式)和语境来源,分析数据集构建趋势。
  • 评估证据标注实践,即明确标注支持性句子,以提升模型可解释性。
  • 提出未来方向:拓展至医疗和社会媒体领域,支持多答案,以及利用BERT-score和BLEURT等先进生成指标实现指标统一化。

实验结果

研究问题

  • RQ1如何基于应用场景而非仅任务类型或数据源,对文本QA基准进行系统性分类?
  • RQ2近期文本QA数据集中,问题和答案收集方法的主要趋势是什么?
  • RQ3不同评估指标在文本QA中各类答案类型和任务类别下的表现如何?
  • RQ4当前基准的关键局限性是什么,特别是在答案多重性和证据理解方面?
  • RQ5哪些未来方向将推动更鲁棒、更具泛化能力且可解释性更强的文本QA系统?

主要发现

  • 综述识别出一种日益增长的趋势:从搜索引擎和QA网站(如Reddit和Stack Overflow)收集真实用户问题,而非合成或众包的填空式问题。
  • 跨度型答案仍是最常见的答案类型,但长文本答案和支撑性证据句子的标注趋势正在上升,以提升模型可解释性。
  • 维基百科是ODQA和MRC数据集的主要语境来源,尽管研究人员正开始探索医疗和社交媒体等非维基百科领域。
  • 当前基准大多仅支持单参考答案,但现实世界的问题常有多个有效答案,表明亟需多答案评估指标。
  • 先进指标如BERT-score和BLEURT相较于传统指标(如ROUGE和BLEU)与人类评估的对齐度更高,表明其在未来的基准测试中具有潜力。
  • 证据标注(即标注支持性句子)正日益被采用,尤其是在复杂QA任务中,以增强模型透明度和推理可追溯性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。