[论文解读] Training a Ranking Function for Open-Domain Question Answering
本文提出了两种用于开放域问答的神经网络排序模型:一种基于语义相似度(InferSent),另一种基于词级相关性匹配(Relation-Networks)。基于语义相似度的排序模型显著提升了整体问答性能,相比基线模型提升11.6%;而基于相关性匹配的排序模型虽然检索召回率更高,但由于与问题的语义对齐较差,导致下游问答准确率较低。
In recent years, there have been amazing advances in deep learning methods for machine reading. In machine reading, the machine reader has to extract the answer from the given ground truth paragraph. Recently, the state-of-the-art machine reading models achieve human level performance in SQuAD which is a reading comprehension-style question answering (QA) task. The success of machine reading has inspired researchers to combine information retrieval with machine reading to tackle open-domain QA. However, these systems perform poorly compared to reading comprehension-style QA because it is difficult to retrieve the pieces of paragraphs that contain the answer to the question. In this study, we propose two neural network rankers that assign scores to different passages based on their likelihood of containing the answer to a given question. Additionally, we analyze the relative importance of semantic similarity and word level relevance matching in open-domain QA.
研究动机与目标
- 通过使用神经排序函数对搜索引擎检索到的文本段落进行重排序,以提升开放域问答性能。
- 探究在开放域问答中,语义相似度与词级相关性匹配的相对重要性。
- 评估神经排序模型是否能够提升机器阅读模型在开放域设置下的性能。
- 分析为何高检索召回率的模型在端到端问答中表现不佳,原因在于缺乏与问题的语义对齐。
提出的方法
- 提出一种基于语义相似度的排序模型,利用固定大小的分布式表示(InferSent)对整个问题和文本段落进行编码。
- 开发一种基于关系网络(Relation-Networks)的词级相关性匹配排序模型,用于计算问题与段落中词语之间的局部交互。
- 在 QUASAR-T 数据集上训练两种排序模型,以对给定问题的相关性得分进行排序。
- 将每种排序模型返回的最高等级段落整合进 DrQA 管道,与神经机器阅读模型(BiDAF)结合使用。
- 使用精确匹配(EM)和 F1 分数在 QUASAR-T 测试集上评估端到端问答性能。
- 比较不同排序模型在检索召回率(正确答案出现在前 N 个段落中的比例)方面的表现。
实验结果
研究问题
- RQ1与词级匹配相比,分布式句子表示中的语义相似度是否能提升开放域问答性能?
- RQ2词级相关性匹配在多大程度上提升了开放域问答中的检索召回率?
- RQ3为何高召回率的检索模型尽管能检索到包含答案的段落,却无法提升整体问答准确率?
- RQ4结合语义相似度与局部词匹配的混合排序模型是否能实现更优的整体问答性能?
主要发现
- 基于 InferSent 的排序模型(依赖语义相似度)相比基线 DrQA 系统,将整体问答性能提升了 11.6%。
- Relation-Networks 排序模型在 top-10 段落中的检索召回率显著更高(70.3%),高于 InferSent(56.7%)和基线(54.5%),表明其具有更强的检索能力。
- 尽管召回率高,Relation-Networks 排序模型的问答性能却更低(EM:26.0%),因为检索到的段落往往与问题缺乏语义对齐。
- 当与 DrQA 结合时,InferSent 排序模型在 EM 上达到 31.2%,F1 达到 37.6%,优于多个先前的 SOTA 模型。
- 研究发现,尽管词级匹配在检索召回率方面表现更优,但语义相似度对整体问答性能的贡献更大。
- Relation-Networks 排序模型有时会为与问题无语义关联的段落赋予高分,表明其可能学习的是共现模式而非有意义的相关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。