Skip to main content
QUICK REVIEW

[论文解读] Hierarchical Question Answering for Long Documents

Eunsol Choi, Daniel Hewlett|arXiv (Cornell University)|Nov 6, 2016
Topic Modeling参考文献 46被引用 8
一句话总结

本文提出了一种从粗到精的问答框架,通过首先使用快速模型筛选相关句子,再对这些句子应用更精确的RNN模型生成答案,从而在长文档上提升效率与性能。该方法将句子选择视为通过仅使用答案进行强化学习训练的隐变量,实现了在长文档问答任务上的最先进结果,并相较基线模型实现了3.5倍至6.7倍的速度提升。

ABSTRACT

We present a framework for question answering that can efficiently scale to longer documents while maintaining or even improving performance of state-of-the-art models. While most successful approaches for reading comprehension rely on recurrent neural networks (RNNs), running them over long documents is prohibitively slow because it is difficult to parallelize over sequences. Inspired by how people first skim the document, identify relevant parts, and carefully read these parts to produce an answer, we combine a coarse, fast model for selecting relevant sentences and a more expensive RNN for producing the answer from those sentences. We treat sentence selection as a latent variable trained jointly from the answer only using reinforcement learning. Experiments demonstrate the state of the art performance on a challenging subset of the Wikireading and on a new dataset, while speeding up the model by 3.5x-6.7x.

研究动机与目标

  • 为解决基于RNN的问答模型在处理长文档时因顺序计算和缺乏并行化而导致的效率低下问题。
  • 提升在长文档问答任务中的性能,该任务中相关信息稀疏且未必明确表达。
  • 开发一种模块化、分层的问答系统,通过先浏览后聚焦关键句子的方式,模拟人类阅读行为。
  • 仅使用答案监督对句子选择进行训练,作为隐变量处理,避免对句子级别标注数据的依赖。

提出的方法

  • 模型采用两阶段架构:快速的粗粒度编码器根据问题从文档中筛选出相关句子。
  • 一个独立的、较慢的RNN仅使用所选句子生成最终答案,从而实现与文档长度无关的高效计算。
  • 句子选择被建模为隐变量,并通过强化学习与答案生成联合训练,奖励由答案准确率决定。
  • 强化学习目标优化答案正确性,无需使用黄金句子标注,仅依赖最终答案作为监督信号。
  • 该框架使用词袋(BoW)表示进行句子选择,使用门控循环单元(GRU)进行答案生成。
  • 在Wikireading Long和一个新数据集WikiSuggest上评估该方法,并对句子选择采样和模型变体进行了消融研究。

实验结果

研究问题

  • RQ1从粗到精的问答框架是否能在显著降低推理时间的同时,提升长文档上的性能?
  • RQ2仅使用答案级别监督联合训练句子选择与答案生成的效果如何?
  • RQ3通过强化学习将句子选择视为隐变量,是否在长文档问答任务中优于强基线模型?
  • RQ4与合成或精心构建的数据集相比,该模型在从搜索引擎收集的真实自然开放域问题上的表现如何?
  • RQ5模型的主要失败模式是什么?在精心构建的数据集与更嘈杂的真实世界QA数据集之间有何差异?

主要发现

  • 该模型在具有挑战性的Wikireading Long子集上实现了最先进性能,尽管未使用黄金句子标注,仍优于先前方法。
  • 在新构建的WikiSuggest数据集上,该模型性能与强基线相当,但文档编码速度提升了3.5倍至6.7倍。
  • 该模型访问的文档词元数量是基线模型(后者会截断文档)的四倍,同时保持高准确率。
  • 人工错误分析显示,在Wikireading Long上最常见的失败原因是文档中缺乏证据,其次是长答案生成错误。
  • 在WikiSuggest上,噪声问题-答案对和错误猜测是常见问题,但模型仍表现良好,表明其对真实世界噪声具有鲁棒性。
  • 推理时采样两个相关句子可提升在Wikireading Long上的性能,表明在困难样本中多个候选句子有助于提升效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。