Skip to main content
QUICK REVIEW

[论文解读] RECONSIDER: Re-Ranking using Span-Focused Cross-Attention for Open Domain Question Answering

Srinivasan Iyer, Sewon Min|arXiv (Cornell University)|Oct 21, 2020
Topic Modeling参考文献 20被引用 8
一句话总结

ReConsider 提出了一种以跨度为中心的重排序模型,通过优化预训练阅读理解模型的高置信度预测,提升了抽取式开放域问答的性能。该方法利用跨度标注的文本片段和聚焦的交叉注意力机制,在多个基准上达到当前最优结果,包括在 Natural Questions 上达到 45.5% 的精确匹配率,在 TriviaQA 上达到 61.7%,优于以往方法,甚至在某些情况下超越了生成式模型。

ABSTRACT

State-of-the-art Machine Reading Comprehension (MRC) models for Open-domain Question Answering (QA) are typically trained for span selection using distantly supervised positive examples and heuristically retrieved negative examples. This training scheme possibly explains empirical observations that these models achieve a high recall amongst their top few predictions, but a low overall accuracy, motivating the need for answer re-ranking. We develop a simple and effective re-ranking approach (RECONSIDER) for span-extraction tasks, that improves upon the performance of large pre-trained MRC models. RECONSIDER is trained on positive and negative examples extracted from high confidence predictions of MRC models, and uses in-passage span annotations to perform span-focused re-ranking over a smaller candidate set. As a result, RECONSIDER learns to eliminate close false positive passages, and achieves a new state of the art on four QA tasks, including 45.5% Exact Match accuracy on Natural Questions with real user questions, and 61.7% on TriviaQA.

研究动机与目标

  • 为解决开放域问答中尽管召回率高但最高排名预测准确率低的问题,通过重排序候选答案跨度来改进。
  • 提升在抽取式问答中对语义相似但错误的假阳性与正确答案之间的判别能力。
  • 开发一种简单且可泛化的重排序方法,利用高置信度 MRC 预测和跨度标注。
  • 在抽取式问答基准上超越现有的检索增强型和生成式模型。
  • 证明对特定跨度进行聚焦推理相比标准跨度选择方法能显著提升性能。

提出的方法

  • ReConsider 在从现有 MRC 模型(如 DPR)的高置信度预测中提取的正样本和负样本上进行训练。
  • 每段文本均标注了候选答案跨度,从而实现问题与标注跨度之间的聚焦交叉注意力。
  • 该模型采用基于 BERT 的架构,通过聚焦于特定跨度的交叉注意力机制,增强对候选答案的推理能力。
  • 它对基础 MRC 模型输出的 top-K 预测(如 top-100)进行重排序,从中选择最置信的跨度。
  • 训练过程中使用了硬负样本,这些样本源自语义相似但错误的答案,从而增强模型的判别能力。
  • 该方法具有良好的可扩展性,且与大规模预训练模型兼容,避免了基于拼接的重排序方法的局限性。

实验结果

研究问题

  • RQ1是否可以通过聚焦于特定答案跨度的重排序模型提升抽取式开放域问答的性能?
  • RQ2在高置信度 MRC 预测中使用更难、更细微的假阳性样本进行训练,是否能带来更好的泛化能力?
  • RQ3基于跨度的交叉注意力是否能优于标准 MRC 模型,以更好地区分语义相近的假阳性?
  • RQ4ReConsider 与当前最先进的检索增强型和生成式问答模型相比表现如何?
  • RQ5与替代输入格式相比,使用跨度标注是否能显著提升重排序的准确性?

主要发现

  • 在 Natural Questions 测试集上,ReConsider 达到 45.5% 的精确匹配率,相比之前 SOTA(DPR)使用小模型时提升了 1.6%。
  • 在 TriviaQA 上,ReConsider 达到 61.7% 的精确匹配率,相比之前小模型的 SOTA 提升了 2.5%。
  • ReConsider 的大模型版本在所有数据集上均优于基于 BERT-large 的 DPR,性能提升约 1%,在 TriviaQA 上达到 61.1% 的精确匹配率。
  • 在 NQ 上,ReConsider 比 RAG 模型(使用 BART-large)高出 1%;在 TriviaQA 上高出 5.5%;在 TREC 上高出 3%,表明其在抽取式问答中具有强大性能。
  • 与答案拼接方式相比,使用跨度标注使 NQ 上的验证准确率提升 1%,证实了聚焦建模的重要性。
  • 推理时 K=5 的预测结果表现最佳,进一步增加 K 值对性能影响极小,表明模型对候选集大小具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。