Skip to main content
QUICK REVIEW

[论文解读] Fast Reading Comprehension with ConvNets

Felix Wu, Ni Lao|arXiv (Cornell University)|Nov 12, 2017
Topic Modeling参考文献 4被引用 17
一句话总结

本文提出一种卷积神经网络架构——门控空洞残差网络(Gated Linear Dilated Residual Network, GLDR),作为阅读理解任务中循环神经网络(RNN)的更快替代方案。通过用空洞卷积和门控线性单元替代LSTM,该模型在SQuAD和TriviaQA数据集上达到最先进性能,同时将推理时间减少高达两个数量级,从而实现在延迟敏感型应用中的实时部署。

ABSTRACT

State-of-the-art deep reading comprehension models are dominated by recurrent neural nets. Their sequential nature is a natural fit for language, but it also precludes parallelization within an instances and often becomes the bottleneck for deploying such models to latency critical scenarios. This is particularly problematic for longer texts. Here we present a convolutional architecture as an alternative to these recurrent architectures. Using simple dilated convolutional units in place of recurrent ones, we achieve results comparable to the state of the art on two question answering tasks, while at the same time achieving up to two orders of magnitude speedups for question answering.

研究动机与目标

  • 为解决循环神经网络(RNN)在阅读理解任务中推理延迟过高的问题,该问题阻碍了搜索引擎和移动助手等应用的实时部署。
  • 探究具有大感受野的卷积架构是否能有效建模文本中的长距离依赖关系,从而替代顺序性的RNN。
  • 开发一种在推理过程中显著降低计算成本和内存使用量的同时保持高答案准确率的模型。
  • 证明空洞卷积结合残差连接与门控单元可在阅读理解基准测试中达到或超越最先进RNN模型的性能。

提出的方法

  • 模型使用空洞卷积扩展卷积核的感受野,而无需增加参数数量,从而实现对长距离依赖关系的有效建模。
  • 在卷积之后应用门控线性单元(GLUs),以学习动态特征门控,相比ReLU提升表征能力。
  • 使用残差连接以稳定训练过程并支持更深的网络结构,防止梯度消失问题。
  • 将该架构应用于BiDAF和DrQA风格的阅读理解框架中,用GLDR模块替代LSTM编码器。
  • 在SQuAD和TriviaQA上使用标准跨度预测损失进行端到端训练,用于答案跨度回归。
  • 通过并行化序列上的卷积操作加速推理,消除RNN的顺序计算瓶颈。

实验结果

研究问题

  • RQ1具有空洞卷积的卷积架构能否有效替代阅读理解任务中的循环网络?
  • RQ2在非循环、卷积设置中,门控线性单元与残差连接是否能提升性能?
  • RQ3空洞卷积在显著降低推理延迟的同时,能在多大程度上实现与RNN相当的性能?
  • RQ4该模型在文档长度增加时的性能表现如何,尤其与自注意力机制相比如何?
  • RQ5轻量级、推理快速的模型能否在大规模阅读理解基准上保持最先进准确率?

主要发现

  • 基于GLDR的模型在SQuAD和TriviaQA上均达到最先进性能,与最佳发布的RNN基线模型相当或略逊一筹。
  • 在TriviaQA的Wikipedia数据集划分上,Conv DrQA模型取得了具有竞争力的结果,性能与先前SOTA相当,但速度显著更快。
  • 与基于LSTM的基线相比,该模型将推理时间减少了高达两个数量级,支持实时部署。
  • GLDR模型的内存使用量随序列长度线性增长,而自注意力机制的内存使用量呈二次增长,因此该模型在处理长文档时更具可扩展性。
  • 消融实验表明,残差连接对模型收敛至关重要,且GLUs在非线性激活方面优于ReLU。
  • 该模型平均仅需编码每33个词中的一个,表明大感受野能高效捕捉长距离上下文信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。