[论文解读] Multi-hop Reading Comprehension through Question Decomposition and Rescoring
该论文提出 DecompRC,一种多跳阅读理解系统,通过跨度预测将复杂问题分解为更简单的单跳子问题,在仅 400 个标注样本上进行训练。该方法在 HotpotQA 上实现了最先进性能,通过结合子问题生成与全局重排序机制,从多个分解路径中选择最佳最终答案,实现可解释的、基于证据的推理。
Multi-hop Reading Comprehension (RC) requires reasoning and aggregation across several paragraphs. We propose a system for multi-hop RC that decomposes a compositional question into simpler sub-questions that can be answered by off-the-shelf single-hop RC models. Since annotations for such decomposition are expensive, we recast sub-question generation as a span prediction problem and show that our method, trained using only 400 labeled examples, generates sub-questions that are as effective as human-authored sub-questions. We also introduce a new global rescoring approach that considers each decomposition (i.e. the sub-questions and their answers) to select the best final answer, greatly improving overall performance. Our experiments on HotpotQA show that this approach achieves the state-of-the-art results, while providing explainable evidence for its decision making in the form of sub-questions.
研究动机与目标
- 为解决多跳阅读理解中的挑战,即证据分散在多个段落中,通过分解使模型能够逐步推理。
- 通过将子问题生成建模为跨度预测任务,减少对昂贵人工标注分解的依赖,仅需 400 个标注样本即可训练。
- 通过引入全局重排序机制,利用完整上下文评估多个分解路径,提升模型的鲁棒性与性能。
- 通过生成人类可解释的子问题作为最终答案的证据,提供可解释的 AI 输出。
提出的方法
- 子问题生成被建模为跨度预测任务,模型从原始问题中预测跨度以形成更简单的单跳问题。
- 每个生成的子问题使用现成的单跳阅读理解模型进行回答,实现模块化与可扩展的推理。
- 分解评分器通过考虑全部上下文和子问题答案,评估多个可能的分解路径,选择最连贯且最准确的最终答案。
- 该系统采用两阶段流程:首先生成多个候选分解;其次基于答案一致性与上下文对齐性对每个分解进行重排序。
- 该方法避免依赖关系逻辑形式或远距离监督,转而依赖极少的人工标注数据(400 个样本)进行监督。
- 最终答案并非基于单一分解选择,而是通过全局优化,综合考虑所有可能的推理路径。
实验结果
研究问题
- RQ1能否仅使用 400 个标注样本,通过跨度预测方法有效训练子问题生成用于多跳阅读理解?
- RQ2是否全局重排序机制通过评估多个分解路径,能优于单一分解选择的性能?
- RQ3在极小数据量下训练的神经子问题生成器,其性能与人工编写的子问题相比如何?
- RQ4与端到端模型相比,基于分解的方法在对抗性干扰段落下是否表现出更强的鲁棒性?
- RQ5基于分解的模型在多跳阅读理解中的主要失败模式是什么?
主要发现
- DecompRC 在 HotpotQA 基准的干扰段落设置与全维基设置下均实现了最先进性能。
- 仅使用 400 个标注分解样本,模型生成的子问题在引导准确答案预测方面与人工编写的子问题效果相当。
- 全局重排序机制通过上下文感知评估显著提升了性能,选择最优分解路径。
- 在包含干扰段落的对抗性设置下,该模型优于强大的 BERT 基线端到端模型,表现出更强的鲁棒性。
- 人工评估显示,基于跨度的子问题(使用人工阅读理解模型)的上限 F1 达到 72.67,表明 47% 的失败源于分解本身的固有限制。
- 失败分析揭示了三种主要失败模式:隐式多跳推理、缺乏显式答案导致需常识推理,以及无法执行计数或算术推理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。