Skip to main content
QUICK REVIEW

[论文解读] Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps

Xanh Ho, Anh-Khoa Duong Nguyen|arXiv (Cornell University)|Nov 2, 2020
Topic Modeling参考文献 28被引用 5
一句话总结

本文提出 2WikiMultiHopQA,一个大规模的多跳问答数据集,结合维基百科与维基数据,以确保多跳推理是必要条件。通过以维基数据三元组的形式提供结构化证据,并使用逻辑规则生成自然且富含推理过程的问题,该数据集能够全面解释和评估模型的推理步骤,在难度和多跳推理需求验证方面优于现有数据集。

ABSTRACT

A multi-hop question answering (QA) dataset aims to test reasoning and inference skills by requiring a model to read multiple paragraphs to answer a given question. However, current datasets do not provide a complete explanation for the reasoning process from the question to the answer. Further, previous studies revealed that many examples in existing multi-hop datasets do not require multi-hop reasoning to answer a question. In this study, we present a new multi-hop QA dataset, called 2WikiMultiHopQA, which uses structured and unstructured data. In our dataset, we introduce the evidence information containing a reasoning path for multi-hop questions. The evidence information has two benefits: (i) providing a comprehensive explanation for predictions and (ii) evaluating the reasoning skills of a model. We carefully design a pipeline and a set of templates when generating a question-answer pair that guarantees the multi-hop steps and the quality of the questions. We also exploit the structured format in Wikidata and use logical rules to create questions that are natural but still require multi-hop reasoning. Through experiments, we demonstrate that our dataset is challenging for multi-hop models and it ensures that multi-hop reasoning is required.

研究动机与目标

  • 解决现有多跳问答数据集中推理过程解释不全面的问题。
  • 确保回答问题时真正需要多跳推理,避免单跳或依赖上下文的捷径。
  • 利用结构化(维基数据)和非结构化(维基百科)数据,结合手工设计的模板,创建高质量且可扩展的数据集。
  • 实现对多跳问答模型中理由(证据)与内省推理(推理路径)的双重评估。
  • 通过启发式优化减少维基百科文本与维基数据三元组之间的不匹配,提升数据集的可靠性。

提出的方法

  • 通过利用维基百科文章摘要与维基数据实体之间的交集,构建数据集的流水线,以确保对齐。
  • 使用预定义模板生成四种问题类型:比较、推理、组合与桥接比较,辅以过滤器排除单跳或依赖上下文的案例。
  • 使用逻辑规则(例如:father(a,b) ∧ father(b,c) ⇒ grandfather(a,c))生成自然且多跳推理密集的问题。
  • 证据以一组维基数据三元组(主语,属性,宾语)的形式提供,为每个问题构建结构化的推理路径。
  • 基于启发式的对齐系统将维基百科句子映射到维基数据三元组,并通过人工验证检测和修正不匹配。
  • 通过多跳模型性能与单跳 BERT 基线模型的对比评估数据集,确认多跳推理是必要条件。

实验结果

研究问题

  • RQ1能否结合非结构化文本(维基百科)与结构化知识(维基数据)构建多跳问答数据集,以确保真正的多跳推理?
  • RQ2如何系统性地生成并验证每个问题的全面且简洁的推理路径(证据)?
  • RQ32WikiMultiHopQA 数据集在多大程度上确保了多跳推理是必需的,而非依赖单跳捷径?
  • RQ4多跳模型在 2WikiMultiHopQA 上的表现与 HotpotQA 等现有基准相比,在难度和推理需求方面有何差异?
  • RQ5能否有效利用知识图谱中的逻辑规则生成自然、多跳推理密集且可解释、具挑战性的问题?

主要发现

  • 2WikiMultiHopQA 数据集包含 192,606 个高质量多跳问答样本,远超现有数据集如 R^4C(4,588 个样本)。
  • 多跳模型在 2WikiMultiHopQA 上的表现低于在 HotpotQA 上的表现,表明其难度更高。
  • 单跳 BERT 模型在 2WikiMultiHopQA 上的 F1 分数比在 HotpotQA 上低 8.7 分,确认多跳推理是真正必需的。
  • 人工检查显示,在随机抽取的 100 个训练样本中,有 8 个存在维基百科文本与维基数据三元组之间的不匹配,凸显改进启发式对齐的必要性。
  • 在问题生成中使用逻辑规则可产生更自然、推理更密集的问题,同时保持多跳推理的要求。
  • 该数据集同时提供理由(证据三元组)与内省推理(结构化推理路径),支持对模型推理过程的全面评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。