Skip to main content
QUICK REVIEW

[论文解读] WIQA: A dataset for "What if..." reasoning over procedural text

Niket Tandon, Bhavana Dalvi Mishra|arXiv (Cornell University)|Sep 10, 2019
Topic Modeling参考文献 14被引用 9
一句话总结

WIQA 引入了一个大规模数据集,包含 40,700 道基于程序性文本的多选 '如果...' 问题,旨在测试对影响链的反事实推理。该数据集通过众包影响图构建,结果显示当前最先进模型的准确率仅为 73.8%,比人类表现低 22.5 个百分点,凸显了在推理间接和段落外扰动方面仍存在重大挑战。

ABSTRACT

We introduce WIQA, the first large-scale dataset of "What if..." questions over procedural text. WIQA contains three parts: a collection of paragraphs each describing a process, e.g., beach erosion; a set of crowdsourced influence graphs for each paragraph, describing how one change affects another; and a large (40k) collection of "What if...?" multiple-choice questions derived from the graphs. For example, given a paragraph about beach erosion, would stormy weather result in more or less erosion (or have no effect)? The task is to answer the questions, given their associated paragraph. WIQA contains three kinds of questions: perturbations to steps mentioned in the paragraph; external (out-of-paragraph) perturbations requiring commonsense knowledge; and irrelevant (no effect) perturbations. We find that state-of-the-art models achieve 73.8% accuracy, well below the human performance of 96.3%. We analyze the challenges, in particular tracking chains of influences, and present the dataset as an open challenge to the community.

研究动机与目标

  • 为解决缺乏用于评估程序性文本中反事实推理的大规模数据集的问题,特别是预测扰动影响的能力。
  • 创建一个基准,不仅测试直接影响,还测试间接(多跳)和段落外的影响链。
  • 通过暴露现有 NLP 模型在一致性、常识推理以及跨段落追踪因果依赖关系方面的局限性,对其构成挑战。
  • 提供一个资源,以支持对影响图推理及语义现象(如定性语言和词汇变异)的研究。

提出的方法

  • 众包工作者为 379 个程序性段落生成了影响图(IGs),表示实体或事件变化之间的正向(+)或负向(−)影响。
  • 每个影响图是一个有向无权图,节点代表扰动(段落内或段落外),边代表因果极性。
  • 基于影响图中的路径,使用模板 '变化X是否导致变化Y?' 衍生出多选题,选项为:(A) 正确,(B) 相反,(C) 无影响。
  • 扰动被分类为段落内(在文本中)、段落外(需要常识)或无关(无影响),以测试推理广度。
  • 评估模型在仅提供段落、不访问影响图的情况下预测正确答案的能力。
  • 使用一致性度量(传递性和析取一致性)评估模型在影响链上预测的逻辑一致性。

实验结果

研究问题

  • RQ1NLP 模型能否准确预测程序性文本中扰动的结果,尤其是当影响是间接的或涉及段落外知识时?
  • RQ2模型在需要常识推理的问题与直接基于文本的问题上的表现如何?
  • RQ3当推理跨越多跳影响链时,模型在多大程度上保持逻辑一致性?
  • RQ4数据中哪些语言和语义现象最挑战当前模型,例如定性语言、否定或词汇变异?

主要发现

  • 表现最佳的 BERT 基础模型在 WIQA 数据集上的准确率为 73.8%,显著低于人类的 96.3%。
  • 在间接影响(2- 和 3-跳链)上的表现显著下降,表明多跳推理仍是主要挑战。
  • 模型预测的一致性较低:传递性和析取一致性得分远低于人类水平,表明其推理缺乏逻辑一致性。
  • 约 65% 的变化表述使用了定性语言(如 '更多'、'更冷'、'更小'),45% 的问题需要段落外的常识知识,增加了难度。
  • 词汇变异(如用 'bee' 代替 'insect')和否定(如 'does not occur')分别出现在 15% 和 6% 的变化中,增加了问题与文本之间的对齐难度。
  • 该数据集暴露了当前模型在追踪因果链和应用全局一致性约束方面存在显著差距,表明需要改进推理架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。