[论文解读] Question Answering from Unstructured Text by Retrieval and Comprehension
本文提出了一种两阶段问答系统,通过检索相关维基百科文章,并应用一种基于RNN的新型注意力混合机制模型,从文本中选择答案片段或从固定词汇表中选择答案。该方法在WikiMovies数据集上实现了最先进性能,错误率降低40%,准确率达到85.8%,通过提升理解能力和神经检索实现。
Open domain Question Answering (QA) systems must interact with external knowledge sources, such as web pages, to find relevant information. Information sources like Wikipedia, however, are not well structured and difficult to utilize in comparison with Knowledge Bases (KBs). In this work we present a two-step approach to question answering from unstructured text, consisting of a retrieval step and a comprehension step. For comprehension, we present an RNN based attention model with a novel mixture mechanism for selecting answers from either retrieved articles or a fixed vocabulary. For retrieval we introduce a hand-crafted model and a neural model for ranking relevant articles. We achieve state-of-the-art performance on W IKI M OVIES dataset, reducing the error by 40%. Our experimental results further demonstrate the importance of each of the introduced components.
研究动机与目标
- 解决从非结构化文本(如维基百科)进行开放域问答的挑战,其中知识库存在不完整或模式受限的问题。
- 通过在统一框架中结合基于片段的答案选择与基于词汇表的答案选择,突破开放域问答中阅读理解的瓶颈。
- 通过引入一种优化下游理解性能的神经排序模型,提升检索质量。
- 通过端到端训练的混合模型,动态选择最适合每类问题的答案生成策略,证明其有效性。
提出的方法
- 采用两步流水线:首先使用手工设计模型或神经排序模型检索相关维基百科文章。
- 应用带有注意力机制的序列到序列RNN,联合处理问题和检索到的文档,以实现答案理解。
- 引入一种混合机制,结合两种答案生成头:一个从文档中预测答案片段(指针网络),另一个从固定词汇表中选择答案(基于实体的softmax)。
- 使用可学习门控(g)动态控制每个头的贡献,使模型能根据问题类型在基于片段和基于词汇表的预测之间切换。
- 端到端训练整个系统,其中检索模型被优化以最大化下游理解性能。
- 利用WikiMovies数据集进行评估,该数据集包含20万组问答对和1.8万部电影文章,涵盖导演到电影、电影到演员以及类型分类等多种问题类型。
实验结果
研究问题
- RQ1统一的神经模型能否有效结合基于片段和基于词汇表的答案选择,用于开放域问答?
- RQ2混合机制在多样化问题类型中如何提升性能,特别是对于答案在文本中有限或不存在显式匹配的问题?
- RQ3与传统检索方法相比,与理解模型联合训练的神经检索模型在多大程度上优于传统方法?
- RQ4所提出的方法在不同问题类别中是否具有泛化能力,特别是对于在文本中缺乏或仅有极少表面匹配的问题?
- RQ5混合模型中的门控机制如何反映问题的内在类型?每种答案生成策略在何种情况下最有效?
主要发现
- 所提出的混合模型在WikiMovies-WE数据集上达到85.4%的Hits@1,相比先前最先进模型KV-MemNN(76.2%)实现9.2%的相对提升。
- 神经检索模型提高了检索文章的精确率与召回率,使在完整WikiMovies数据集上的整体准确率达到85.8%。
- 除两类问题外,模型在所有问题类型中均实现超过80%的准确率,其中在movie_to_x类别中提升最大,如movie_to_writer(64%提升至90%)和movie_to_actors(64%提升至84%)。
- 混合门控(g)在选择类问题(如movie_to_genre)中最为活跃(g > 0.5,占72%时间),表明当答案选项有限时,基于词汇表的选择更受青睐。
- 在12个类别中的8个类别中,该模型优于纯基于词汇表的基线模型,证明了动态切换答案生成模式的优势。
- 该系统在不依赖数据集特定特征或大量启发式工程的情况下,实现了最先进结果,凸显了端到端神经方法的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。