Skip to main content
QUICK REVIEW

[论文解读] Understanding Dataset Design Choices for Multi-hop Reasoning

Jifan Chen, Greg Durrett|arXiv (Cornell University)|Apr 27, 2019
Topic Modeling参考文献 25被引用 9
一句话总结

本文研究了最先进的模型在WikiHop和HotpotQA这两个主流多跳问答数据集上表现优异时,是否真正需要多跳推理。通过测试仅独立分析每个句子的句子分解模型以及仅使用问题和答案候选的无上下文基线模型,作者发现两个数据集中超过一半的样本无需多跳推理即可解决,且强性能可通过虚假相关性实现——这引发了对当前模型是否真正学习复杂推理能力的严重质疑。

ABSTRACT

Learning multi-hop reasoning has been a key challenge for reading comprehension models, leading to the design of datasets that explicitly focus on it. Ideally, a model should not be able to perform well on a multi-hop question answering task without doing multi-hop reasoning. In this paper, we investigate two recently proposed datasets, WikiHop and HotpotQA. First, we explore sentence-factored models for these tasks; by design, these models cannot do multi-hop reasoning, but they are still able to solve a large number of examples in both datasets. Furthermore, we find spurious correlations in the unmasked version of WikiHop, which make it easy to achieve high performance considering only the questions and answers. Finally, we investigate one key difference between these datasets, namely span-based vs. multiple-choice formulations of the QA task. Multiple-choice versions of both datasets can be easily gamed, and two models we examine only marginally exceed a baseline in this setting. Overall, while these datasets are useful testbeds, high-performing models may not be learning as much multi-hop reasoning as previously thought.

研究动机与目标

  • 评估多跳推理是否真正为在WikiHop和HotpotQA这两个广泛使用的多跳问答数据集上实现高性能所必需。
  • 评估模型在多大程度上可通过虚假相关性或浅层模式匹配而非真正推理实现高性能。
  • 比较基于跨度的监督与多项选择监督在抑制通过问题-答案候选相关性‘作弊’行为方面的有效性。
  • 探究在这些数据集的多项选择版本上表现强劲是否反映了真正的多跳推理,还是仅仅利用了表面统计线索。
  • 通过使用句子分解模型进行对抗性评估,为构建更具鲁棒性的多跳推理数据集提供指导。

提出的方法

  • 提出一种句子分解模型,独立评估每个句子是否包含答案,而不使用其他句子的信息,以检验多跳推理是否必要。
  • 训练并评估一个仅使用问题和答案候选的无上下文基线模型,完全忽略段落内容,以检测虚假相关性。
  • 通过比较两种数据集在多项选择与基于跨度的设定下的性能,评估监督类型对模型行为的影响。
  • 通过候选映射过滤跨度预测,将基于跨度的模型(BiDAF++)适配到多项选择设置,以检验基于跨度的监督是否能提升推理鲁棒性。
  • 通过增加多项选择选项数量进行消融研究,测试当虚假相关性被削弱时,模型性能是否下降。
  • 使用句子分解模型进行对抗性评估,识别出无需多跳推理的样本,作为数据集设计的诊断工具。

实验结果

研究问题

  • RQ1基于句子级别的独立预测,模型在在多大程度上可以不依赖多跳推理解决WikiHop和HotpotQA?
  • RQ2在这些数据集的多项选择版本中,问题与答案候选之间的虚假相关性有多强?
  • RQ3与多项选择监督相比,基于跨度的监督是否能带来更好的泛化能力并减少对表面线索的依赖?
  • RQ4即使在相同评估设置下,基于跨度数据训练的模型是否能超越原生在多项选择数据上训练的模型?
  • RQ5在多项选择数据集上训练的模型在在多大程度上真正学习了多跳推理,还是仅仅利用了问题-候选相关性?

主要发现

  • 超过60%的WikiHop样本和超过45%的HotpotQA样本可由仅独立处理每个句子的句子分解模型解决,表明许多样本并不要求多跳推理。
  • 仅使用问题和答案候选的无上下文基线模型在WikiHop上达到60.9%的准确率,在HotpotQA上达到45.4%,表明数据中存在强烈的虚假相关性。
  • 两个数据集的多项选择版本均易受‘作弊’影响,因为无上下文基线模型在该设置下的表现几乎与复杂模型相当。
  • 基于跨度的监督比多项选择监督更具鲁棒性,因为基于跨度数据训练的模型(如Span2MC-BiDAF++)表现优于原生在多项选择数据上训练的模型。
  • 即使增加多项选择选项数量,无上下文基线模型的性能仍与复杂模型相当,表明模型仍未真正学习到多跳推理能力。
  • 句子分解的BiDAF模型在某些设置下甚至优于最佳基于跨度的模型,表明许多模型可能依赖于强大的单句推理能力,而非真正的多跳推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。