Skip to main content
QUICK REVIEW

[论文解读] RikiNet: Reading Wikipedia Pages for Natural Question Answering

Dayiheng Liu, Yeyun Gong|arXiv (Cornell University)|Apr 30, 2020
Topic Modeling参考文献 27被引用 14
一句话总结

RikiNet 是一种新型机器阅读理解模型,专为长篇维基百科页面上的开放域问答设计,引入了动态段落双注意力阅读器和多级级联答案预测器,以联合预测短答案片段、长答案段落和答案类型。其在长答案任务上达到 74.3 F1,在短答案任务上达到 57.9 F1,成为首个在 Natural Questions 基准上超越单人类表现的单一模型。

ABSTRACT

Reading long documents to answer open-domain questions remains challenging in natural language understanding. In this paper, we introduce a new model, called RikiNet, which reads Wikipedia pages for natural question answering. RikiNet contains a dynamic paragraph dual-attention reader and a multi-level cascaded answer predictor. The reader dynamically represents the document and question by utilizing a set of complementary attention mechanisms. The representations are then fed into the predictor to obtain the span of the short answer, the paragraph of the long answer, and the answer type in a cascaded manner. On the Natural Questions (NQ) dataset, a single RikiNet achieves 74.3 F1 and 57.9 F1 on long-answer and short-answer tasks. To our best knowledge, it is the first single model that outperforms the single human performance. Furthermore, an ensemble RikiNet obtains 76.1 F1 and 61.3 F1 on long-answer and short-answer tasks, achieving the best performance on the official NQ leaderboard

研究动机与目标

  • 为解决使用长篇维基百科页面回答开放域问题的挑战,这些页面相比短文本包含更多噪声和复杂性。
  • 提升在 Natural Questions (NQ) 数据集上的表现,现有模型因长上下文和双重答案类型(短片段和长段落)而表现受限。
  • 设计一个统一模型,以级联方式联合预测短答案、长答案和答案类型,提升推理能力和泛化性能。
  • 克服先前模型将短答案和长答案独立处理或依赖外部检索的局限性。
  • 在不使用大量数据增强或集成技术的情况下,仅通过单一模型实现最先进性能。

提出的方法

  • 动态段落双注意力(DPDA)阅读器使用迭代双注意力机制,学习文档词元和段落级表示的问答感知表示。
  • 通过动态注意力掩码聚焦于每个段落内的关键词元,增强上下文感知能力并减少无关内容带来的噪声。
  • 多级级联答案预测器以顺序、分层的方式联合预测短答案片段、长答案段落和答案类型。
  • 使用问题嵌入作为答案类型预测的辅助先验,提升无短答案问题的泛化能力。
  • 采用基于 BERT 的主干网络,结合微调的 WordPiece 分词和使用 ReLU 类激活(Tanh)的密集输出层。
  • 模型在 NQ 数据上端到端训练,通过滑动窗口生成多个文档片段以覆盖完整的维基百科页面。

实验结果

研究问题

  • RQ1单一模型能否有效处理长篇维基百科页面的开放域问答任务,同时联合预测短答案片段和长答案段落?
  • RQ2与独立或顺序预测相比,对答案类型、短答案和长答案的级联预测在性能上提升有多大?
  • RQ3聚焦于关键段落词元的动态注意力机制在长文档中能在多大程度上改善表示学习?
  • RQ4将问题级嵌入作为答案类型预测的先验信号,是否能增强模型鲁棒性,特别是针对无短答案的问题?
  • RQ5单一模型能否在不依赖数据增强或集成方法的情况下,超越 Natural Questions 基准上的单人类表现?

主要发现

  • RikiNet 使用单一模型在长答案任务上达到 74.3 F1,在短答案任务上达到 57.9 F1,优于此前最佳单一模型(66.8 和 53.9 F1),并超越单人类表现(73.2 和 56.8 F1)。
  • RikiNet 的集成版本在长答案任务上达到 76.1 F1,在短答案任务上达到 61.3 F1,截至 2019 年 11 月 29 日,在官方 NQ 排行榜上达到最先进性能。
  • 消融实验表明,多级级联预测器和 DPDA 阅读器均对性能有显著贡献,级联结构相比非级联基线使长答案 F1 提升超过 7 个百分点。
  • 移除用于答案类型预测的问题嵌入会导致性能下降,证实其作为先验信号的价值。
  • 将密集输出层替换为 Bi-LSTM、Transformer 或 GELU 激活层仅带来微小性能提升,表明当前设计已接近最优。
  • 由于集成了答案类型预测,该模型在泛化能力方面表现强劲,尤其在无短答案的问题上。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。