Skip to main content
QUICK REVIEW

[论文解读] ArchivalQA: A Large-scale Benchmark Dataset for Open Domain Question Answering over Historical News Collections

Jiexin Wang, Adam Jatowt|arXiv (Cornell University)|Sep 8, 2021
Topic Modeling被引用 4
一句话总结

ArchivalQA 引入了一个大规模开放域问答(ODQA)基准,基于《纽约时报注释文集》(1987–2007年)构建,包含532,444个问题-答案对,采用半自动流程结合神经问题生成与多阶段过滤,生成高质量、具有时间定位性的问题。该数据集按难度和时间表达式存在与否划分为子数据集,支持对历史新闻中ODQA模型的细粒度评估,DPR模型在困难、词汇重叠度低的问题上表现优异。

ABSTRACT

In the last few years, open-domain question answering (ODQA) has advanced rapidly due to the development of deep learning techniques and the availability of large-scale QA datasets. However, the current datasets are essentially designed for synchronic document collections (e.g., Wikipedia). Temporal news collections such as long-term news archives spanning several decades, are rarely used in training the models despite they are quite valuable for our society. To foster the research in the field of ODQA on such historical collections, we present ArchivalQA, a large question answering dataset consisting of 532,444 question-answer pairs which is designed for temporal news QA. We divide our dataset into four subparts based on the question difficulty levels and the containment of temporal expressions, which we believe are useful for training and testing ODQA systems characterized by different strengths and abilities. The novel QA dataset-constructing framework that we introduce can be also applied to generate non-ambiguous questions of good quality over other types of temporal document collections.

研究动机与目标

  • 为长期历史新闻档案缺乏大规模、高质量的ODQA数据集的问题提供解决方案,尽管这些档案具有重要的社会价值但尚未被充分利用。
  • 开发一种可扩展的半自动框架,利用神经问题生成与过滤技术,在时间文档集合上生成多样化、无歧义的问题。
  • 构建一个能捕捉时间推理挑战(包括时间歧义和跨 decades 的词汇变化)的基准。
  • 通过根据问题难度和时间表达式存在与否对问题进行区分,实现对ODQA系统的细粒度评估。
  • 通过一个丰富、多样且具有时间定位性的数据集,支持时间信息检索、历史事实查找以及教育领域的研究。

提出的方法

  • 利用神经问题生成模型,从《纽约时报》语料库(1987–2007年)的新闻文章中自动生成大量候选问题。
  • 应用一系列级联过滤步骤——基于相关性、歧义性和事实一致性——以去除低质量问题,保留高质量的QA实例。
  • 根据问题难度和时间表达式存在与否,将最终数据集划分为四个子数据集:ArchivalQAEasy、ArchivalQAHard、ArchivalQATime 和 ArchivalQANoTime。
  • 以《纽约时报》语料库作为底层文档集合,确保训练与评估过程中具备时间一致性与历史深度。
  • 将每个子数据集按 80% 训练集、10% 验证集和 10% 测试集进行划分,以实现标准化评估。
  • 在子数据集上评估多种ODQA模型,包括稀疏检索器(如 BERTserini)和密集检索器(如 DPR),以分析性能差异。

实验结果

研究问题

  • RQ1现有ODQA模型在长期新闻档案上回答详细、历史特定问题时的效能如何?
  • RQ2问题中时间表达式的存在在多大程度上影响模型在历史问答任务上的表现?
  • RQ3密集检索模型(如 DPR)是否能在时间文档集合中,于困难、低词汇重叠度的问题上超越稀疏检索模型?
  • RQ4如按复杂度与词汇重叠度定义,问题难度如何影响ODQA系统的表现?
  • RQ5结合多阶段过滤的半自动流程能否生成高质量、无歧义的QA对,以适用于档案数据上ODQA系统的训练与评估?

主要发现

  • DPR 模型在 ArchivalQAHard 上优于稀疏检索器,精确匹配(EM)提升 54.85%,F1 提升 40.35%,表明其在低词汇重叠问题上具备强大泛化能力。
  • BERTserini-NYT-TempRes 在 ArchivalQAHard 上的 EM 相较于 ArchivalQAEasy 提升 106.83%,证实了困难问题的挑战性。
  • 模型在 ArchivalQANoTime 上的表现略优于 ArchivalQATime,表明时间信号目前可能未被充分利用,甚至在未被正确建模时可能产生负面影响。
  • 该半自动框架成功生成了 532,444 个高质量 QA 对,子数据集支持基于难度和时间内容的细粒度评估。
  • 该数据集揭示,基于 Wikipedia 的知识不足以回答详细、次要的历史事件,凸显了在 ODQA 中使用档案新闻来源的必要性。
  • 简单问题与困难问题之间的性能差距凸显了时间推理与上下文理解在历史问答系统中的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。