Skip to main content
QUICK REVIEW

[论文解读] Ranking Paragraphs for Improving Answer Recall in Open-Domain Question Answering

Jinhyuk Lee, Seongjun Yun|arXiv (Cornell University)|Oct 1, 2018
Topic Modeling参考文献 18被引用 13
一句话总结

本文提出 Paragraph Ranker,一种基于学习排序的模型,通过重新排序从检索文档中获得的段落,提升开放域问答中的答案召回率。该模型使用双向LSTM编码器和简单的相似度函数(点积、双线性、多层感知机),在输入阅读器模型前筛选出最相关的段落,在不修改阅读器架构的前提下,使四个数据集的精确匹配分数平均提升7.8%。

ABSTRACT

Recently, open-domain question answering (QA) has been combined with machine comprehension models to find answers in a large knowledge source. As open-domain QA requires retrieving relevant documents from text corpora to answer questions, its performance largely depends on the performance of document retrievers. However, since traditional information retrieval systems are not effective in obtaining documents with a high probability of containing answers, they lower the performance of QA systems. Simply extracting more documents increases the number of irrelevant documents, which also degrades the performance of QA systems. In this paper, we introduce Paragraph Ranker which ranks paragraphs of retrieved documents for a higher answer recall with less noise. We show that ranking paragraphs and aggregating answers using Paragraph Ranker improves performance of open-domain QA pipeline on the four open-domain QA datasets by 7.8% on average.

研究动机与目标

  • 为解决传统信息检索系统在检索包含答案的文档方面存在的局限性,该局限性会降低开放域问答的性能。
  • 通过在检索文档内对段落进行排序,而非仅依赖文档级别的检索,提升开放域问答中的答案召回率。
  • 通过在输入阅读器模型前过滤低分段落内容,减少无关段落带来的噪声。
  • 证明段落级别的重新排序可显著提升问答性能,且无需修改底层阅读器模型。
  • 提供一种简单而有效的方法,可与现有端到端学习排序方法在问答流程中互补。

提出的方法

  • Paragraph Ranker 使用双向LSTM(Bi-LSTM)将问题和段落编码为密集向量表示。
  • 通过相似度函数(点积、双线性形式或多层感知机(MLP))计算段落包含答案的概率。
  • 模型采用负采样策略,高效地在大规模段落对上进行训练,降低计算成本。
  • 基于预测的相关性得分,从N个检索文档(例如N=20)中选择前M个段落(例如M=200)。
  • 采用基于覆盖度的方法聚合答案,该方法结合了在前几大段落中重复答案的未归一化概率。
  • 该流程将 Paragraph Ranker 集成在文档检索与文档阅读之间,提升召回率的同时过滤噪声。

实验结果

研究问题

  • RQ1在不修改阅读器模型的前提下,段落级别的重新排序能否提升开放域问答中的答案召回率?
  • RQ2Paragraph Ranker 在精确匹配性能方面与传统文档检索方法及端到端学习排序方法相比如何?
  • RQ3当结合段落排序时,增加检索文档数量在多大程度上能提升召回率?
  • RQ4在段落排序中,哪种相似度函数(点积、双线性、MLP)在效率与性能之间提供了最佳平衡?
  • RQ5当检索系统返回的最高分文档与问题无关时,Paragraph Ranker 是否仍能有效识别相关段落?

主要发现

  • 与基线模型 DrQA 相比,Paragraph Ranker + Full Agg. 在四个开放域问答数据集上的精确匹配分数平均提升7.8%。
  • 在 SQuAD_OPEN 上,该方法实现了3.78%的相对精确匹配提升,优于 DrQA 和强化阅读器-排序器(R³)模型。
  • 在 CuratedTrec 上,提升幅度达到24.65%的相对值,表明在查询复杂或模糊的数据集中具有显著增益。
  • 在 SQuAD 开发集上验证显示,该模型在前5个段落中保持96.7%的高召回率,同时有效过滤了无关内容。
  • 定性分析表明,即使检索器返回的最高分文档与问题无关,Paragraph Ranker 仍能正确识别相关段落,尤其在多义词(如 'play')场景下表现突出。
  • 使用简单评分函数(如点积)即可达到与更复杂模型(如MLP)相当的性能,且推理成本显著降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。