Skip to main content
QUICK REVIEW

[论文解读] WikiPassageQA: A Benchmark Collection for Research on Non-factoid Answer Passage Retrieval

Daniel J. Cohen, Yang Liu|arXiv (Cornell University)|May 10, 2018
Topic Modeling参考文献 17被引用 13
一句话总结

本文介绍了 WikiPassageQA,这是一个大规模基准数据集,包含从维基百科文章中提取的 4,165 个非事实型问题,每个问题均附有长度不一的标注答案段落。该数据集可用于评估神经网络与传统信息检索(IR)模型在答案段落检索任务中的表现,结果表明现有神经架构在处理长段落时表现不佳,而一种引入记忆机制的 CNN-LSTM 模型优于所有基线模型,凸显了非事实型段落检索中的独特挑战。

ABSTRACT

With the rise in mobile and voice search, answer passage retrieval acts as a critical component of an effective information retrieval system for open domain question answering. Currently, there are no comparable collections that address non-factoid question answering within larger documents while simultaneously providing enough examples sufficient to train a deep neural network. In this paper, we introduce a new Wikipedia based collection specific for non-factoid answer passage retrieval containing thousands of questions with annotated answers and show benchmark results on a variety of state of the art neural architectures and retrieval models. The experimental results demonstrate the unique challenges presented by answer passage retrieval within topically relevant documents for future research.

研究动机与目标

  • 为话题相关文档中的非事实型答案段落检索任务,填补大规模、公开可用基准数据集的空白。
  • 提供一个适用于在段落级答案检索背景下训练和评估深度神经网络的资源。
  • 建立一个标准基准,用于比较传统 IR 模型与神经架构在非事实型问答任务中的表现。
  • 突出检索长度超过单个句子但短于完整文档的答案段落所面临的独特挑战。
  • 支持未来针对长且富含上下文信息的答案段落量身定制的神经 IR 模型研究。

提出的方法

  • 使用 Amazon Mechanical Turk 从 863 篇维基百科文章中生成 4,165 个非事实型问题,并标注答案段落的起始与结束位置。
  • 问题设计旨在反映聚焦的信息需求,与先前数据集(如 WebAP)中使用的宽泛查询不同。
  • 数据集被划分为 3,332 个训练集、417 个开发集和 416 个测试集查询,保留文档级别的划分以确保评估的现实性。
  • 评估了多种模型,包括 TF-IDF、BM25、查询似然(Query Likelihood)以及五种深度神经网络:LSTM、CNN+TF、LSTM-CNN+TF、Char+Word-CNN-LSTM 和 Memory-CNN-LSTM-TF。
  • Memory-CNN-LSTM-TF 模型利用基于 doc2vec 的记忆张量,通过句子迭代更新相关性表征,同时整合词频与生成概率。
  • 评估采用标准 IR 指标,如平均平均精度(MAP)和归一化折损累计增益(nDCG),结果在测试集上报告。

实验结果

研究问题

  • RQ1与神经网络相比,传统 IR 模型在非事实型答案段落检索任务中的表现如何?
  • RQ2现有神经架构在应用于长答案段落(平均长度 142.7 个词)时存在哪些性能局限?
  • RQ3引入记忆机制的神经网络是否能比标准 RNN 或 CNN 更好地建模答案段落检索中的长距离依赖关系?
  • RQ4与 WebAP 和 SQuAD 等现有数据集相比,WikiPassageQA 在规模和质量上如何支持深度学习研究?
  • RQ5非事实型答案段落检索带来了哪些独特挑战,而这些挑战在事实型问答或句子级检索任务中并未体现?

主要发现

  • Memory-CNN-LSTM-TF 模型在 WikiPassageQA 上表现最佳,优于所有传统 IR 模型及其他神经架构。
  • 传统 IR 模型如查询似然(QL)表现具有竞争力,优于五种神经模型中的四种,表明该任务存在强大的基线性能。
  • CNN+TF 模型未能超越 BM25 基线,表明标准 CNN 架构在该粒度的段落级检索任务中难以实现泛化。
  • WikiPassageQA 中答案段落的平均长度为 142.7 个词,显著长于以往神经模型通常针对的约 50 个词的段落,凸显了泛化能力的关键挑战。
  • 该数据集的规模(4,165 个查询)和标注质量使其适用于训练深度神经网络,填补了现有基准中的关键空白。
  • 结果表明,非事实型问题的答案段落检索涉及与事实型或句子级问答任务不同的独特挑战,尤其体现在对长且上下文连贯的答案跨度的建模上。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。