[论文解读] Do Multi-hop Readers Dream of Reasoning Chains?
本文研究多跳问答模型是否能有效利用显式推理链——即支持性段落的有序序列——通过对比单段落与完整推理链设置下的性能表现。尽管现有模型的性能提升有限(最高仅提升1.29% F1),作者提出一种共匹配方法,实现13.1%的错误率降低,证明更优的推理架构可充分释放推理链在多跳问答中的潜力。
General Question Answering (QA) systems over texts require the multi-hop reasoning capability, i.e. the ability to reason with information collected from multiple passages to derive the answer. In this paper we conduct a systematic analysis to assess such an ability of various existing models proposed for multi-hop QA tasks. Specifically, our analysis investigates that whether providing the full reasoning chain of multiple passages, instead of just one final passage where the answer appears, could improve the performance of the existing QA models. Surprisingly, when using the additional evidence passages, the improvements of all the existing multi-hop reading approaches are rather limited, with the highest error reduction of 5.8% on F1 (corresponding to 1.3% absolute improvement) from the BERT model. To better understand whether the reasoning chains could indeed help find correct answers, we further develop a co-matching-based method that leads to 13.1% error reduction with passage chains when applied to two of our base readers (including BERT). Our results demonstrate the existence of the potential improvement using explicit multi-hop reasoning and the necessity to develop models with better reasoning abilities.
研究动机与目标
- 评估现有多跳问答模型是否能有效利用由多个支持性段落组成的显式推理链。
- 探究完整推理路径的可用性是否能在多跳问答中带来可测量的性能提升。
- 提出一种新方法,通过显式建模问题、上下文和答案段落之间的关系来增强模型推理能力。
- 构建一个具有真实推理链的基准数据集,以实现对问答模型推理能力的系统性评估。
- 揭示模型能力与推理链潜力之间的差距,呼吁设计更优的模型以实现真正的多跳推理。
提出的方法
- 基于HotpotQA数据集构建新的评估设置,其中每个问题均配有由人工标注的两段支持性段落组成的推理链。
- 设计两种训练/评估设置:(1) 单源模型(仅包含答案的段落)和(2) 有序源模型(按正确顺序排列的完整推理链)。
- 提出一种共匹配机制,联合编码问题、上下文段落和答案段落,以建模跨段落之间的交互关系。
- 将共匹配模块扩展至BERT和HotpotReader模型,以提升对段落链的推理能力。
- 采用二分类头预测段落顺序,评估模型从无序链中推断推理流程的能力。
- 在https://github.com/helloeve/bert-co-matching发布代码与数据,以确保可复现性并支持未来基准测试。
实验结果
研究问题
- RQ1当模型获得完整的支持性段落推理链而非仅包含答案的段落时,现有多跳问答模型能否实现显著的性能提升?
- RQ2即使提供了正确顺序,模型是否具备足够的归纳偏置来利用推理链的结构?
- RQ3是否存在一种模型架构,能够有效利用推理链在多跳问答中实现显著的性能提升?
- RQ4现有数据集中的数据偏差在多大程度上掩盖了模型的真实推理能力?如何改进评估方式以更真实地反映模型的推理能力?
主要发现
- 现有多跳问答模型(包括BERT)在获得完整推理链时性能提升极小——BERT模型的F1最高仅提升1.29%(绝对值1.3%)。
- BERT模型在二分类任务中仅达到87.43%的准确率,用于判断哪一段是上下文、哪一段是答案,表明其对推理链顺序的建模能力较弱。
- 所提出的共匹配方法在应用于BERT时,于有序源模型设置下实现13.1%的错误率降低,证明当推理链被恰当建模时,其具有显著优势。
- 当应用于HotpotReader和BERT时,共匹配方法相较于单源模型设置,分别实现3.88%和2.91%的F1提升,证实显式推理建模的有效性。
- 结果表明,现有模型性能未提升的原因并非推理链信息不足,而是推理归纳偏置不足所致。
- 本研究证实推理链具有实际价值,且在设计具备更强推理能力的模型方面尚有巨大潜力,尤其在低偏差评估设置中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。