Skip to main content
QUICK REVIEW

[论文解读] Compositional Questions Do Not Necessitate Multi-hop Reasoning

Sewon Min, Eric Wallace|arXiv (Cornell University)|Jun 7, 2019
Topic Modeling参考文献 17被引用 17
一句话总结

本文挑战了组合性问题本质上需要多跳推理的假设,通过实证表明,单跳 BERT 模型在 HotpotQA 上达到了 67 F1 的性能,与当前最先进水平的多跳模型相当。作者指出,由于存在强烈的实体类型信号和冗余事实,许多问题实际上可通过单跳解决。此外,即使在仅提供一个黄金段落的情况下,人类标注者也能正确回答超过 80% 的问题,表明当前数据集高估了多跳推理的需求。

ABSTRACT

Multi-hop reading comprehension (RC) questions are challenging because they require reading and reasoning over multiple paragraphs. We argue that it can be difficult to construct large multi-hop RC datasets. For example, even highly compositional questions can be answered with a single hop if they target specific entity types, or the facts needed to answer them are redundant. Our analysis is centered on HotpotQA, where we show that single-hop reasoning can solve much more of the dataset than previously thought. We introduce a single-hop BERT-based RC model that achieves 67 F1---comparable to state-of-the-art multi-hop models. We also design an evaluation setting where humans are not shown all of the necessary paragraphs for the intended multi-hop reasoning but can still answer over 80% of questions. Together with detailed error analysis, these results suggest there should be an increasing focus on the role of evidence in multi-hop reasoning and possibly even a shift towards information retrieval style evaluations with large and diverse evidence collections.

研究动机与目标

  • 探究多跳阅读理解数据集中组合性问题是否真正需要跨多个段落进行推理。
  • 评估单跳推理在现有如 HotpotQA 等多跳数据集上的解决能力。
  • 评估当前的干扰项选择方法是否能有效强制实现多跳推理,还是允许单跳解法。
  • 探索能更好强制实现多跳推理的替代评估范式,例如对抗性干扰项选择或开放域检索。
  • 识别当前多跳数据集设计中的缺陷,这些缺陷使得模型和人类能够绕过必需的推理步骤。

提出的方法

  • 训练一个单跳 BERT 基础问答模型,独立阅读并评分每个段落,选择答案置信度最高的段落作为输出。
  • 在标准 HotpotQA 开发集上使用标准干扰项评估该模型,获得 67.08 F1 的性能。
  • 使用 TF-IDF 相似度选择对抗性干扰项,随后根据模型预测的答案置信度进行过滤,以识别具有误导性的段落。
  • 开展人工评估,标注者仅获得每个问题的两个黄金段落中的一个,以模拟证据不完整的情况。
  • 在对抗性选择的干扰项上对模型进行微调,以测试其在新干扰项分布下的鲁棒性和泛化能力。
  • 对干扰项应用实体类型过滤机制,以减少与黄金段落实体类型匹配带来的偏差。

实验结果

研究问题

  • RQ1尽管数据集设计为支持多跳推理,单跳模型在 HotpotQA 中的组合性问题上能解决到何种程度?
  • RQ2为何 HotpotQA 中的许多问题即使被明确标记为组合性问题,仍可通过单跳推理解决?
  • RQ3对抗性干扰项选择能否有效防止单跳模型在多跳数据集上取得高性能?
  • RQ4当单跳模型面对更真实、更多样化或对抗性干扰项集时,其性能如何下降?
  • RQ5实体类型和冗余事实在此类多跳问答数据集中如何促进单跳解决方案的实现?

主要发现

  • 单跳 BERT 模型在标准 HotpotQA 开发集上达到 67.08 F1,与当前最先进多跳模型性能相当。
  • 当仅提供两个黄金段落中的一个时,超过 80% 的 HotpotQA 问题可被人类正确回答,表明多跳推理并非始终必要。
  • HotpotQA 中 35% 的桥接型问题可通过单跳推理解决,原因在于强烈的实体类型信号和证据中的冗余事实。
  • 对抗性干扰项选择使单跳模型性能从 67.08 F1 降至 46.84 F1,但微调后性能恢复至 60.10 F1,表明模型能适应新的干扰项分布。
  • 即使在开放域设置下使用 500 个 TF-IDF 检索段落,单跳模型仅达到 39.12 F1,表明标准检索方法难以定位黄金段落;当加入两个黄金段落时,性能显著提升至 53.12 F1。
  • 在原始干扰项上通过实体类型过滤干扰项,模型性能降至 40.73 F1;但若在对抗性选择且经类型过滤的干扰项上微调,性能可恢复至 58.42 F1,表明实体类型偏差是促成单跳解法的关键因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。