Skip to main content
QUICK REVIEW

[论文解读] FastFusionNet: New State-of-the-Art for DAWNBench SQuAD

Felix Wu, Boyi Li|ArXiv.org|Feb 28, 2019
Topic Modeling参考文献 39被引用 4
一句话总结

FastFusionNet 提出了一种计算效率更高的 FusionNet 变体,用于 SQuAD 阅读理解任务,用轻量级 SRU 层替代了昂贵的 CoVe 嵌入和 BiLSTM 层。该模型在保持最先进 F1 分数的同时,实现了最先进的训练和推理速度——18 分钟内达到 75% F1,推理延迟低至 7.9ms,是迄今为止 DAWNBench SQuAD 基准测试中速度最快的模型。

ABSTRACT

In this technical report, we introduce FastFusionNet, an efficient variant of FusionNet [12]. FusionNet is a high performing reading comprehension architecture, which was designed primarily for maximum retrieval accuracy with less regard towards computational requirements. For FastFusionNets we remove the expensive CoVe layers [21] and substitute the BiLSTMs with far more efficient SRU layers [19]. The resulting architecture obtains state-of-the-art results on DAWNBench [5] while achieving the lowest training and inference time on SQuAD [25] to-date. The code is available at https://github.com/felixgwu/FastFusionNet.

研究动机与目标

  • 解决高性能阅读理解模型中计算效率不足的问题,特别是那些为准确率优化而牺牲速度的模型。
  • 在不牺牲 SQuAD 上性能的前提下,减少阅读理解模型的训练和推理时间。
  • 在训练和推理速度方面,实现 DAWNBench SQuAD 基准测试中的最先进水平。
  • 通过用计算开销更小的替代组件替换计算密集型模块(如 CoVe 嵌入和 BiLSTM),优化 FusionNet。
  • 证明在不造成显著准确率损失的情况下,可通过架构改进实现效率提升,同时保持与先前 SOTA 模型相当的 F1 分数。

提出的方法

  • 用标准预训练词向量替代 CoVe 嵌入,以消除昂贵的上下文编码开销。
  • 用简单循环单元(SRUs)替代 BiLSTM 层,通过将矩阵乘法与循环过程解耦以实现并行化。
  • 在 SRUs 中使用向量求和式递推机制,以支持隐藏状态的并行计算,减少串行计算瓶颈。
  • 保留与 FusionNet 相同的注意力机制和融合架构,但通过 SRU 的高效性优化推理过程。
  • 使用 PyTorch v0.3.1 实现模型,采用单精度浮点运算,并对序列特征应用变 dropout。
  • 训练 100 个周期,早停策略设为 60 个周期,使用 Adam 优化器并应用梯度裁剪,固定超参数来自先前工作。

实验结果

研究问题

  • RQ1高性能阅读理解模型的计算效率是否能在不损失性能的前提下得到显著提升?
  • RQ2用 SRUs 替代 CoVe 和 BiLSTM 对 SQuAD 上的训练和推理速度有何影响?
  • RQ3模型是否能在保持竞争力 F1 分数的同时,实现在 DAWNBench SQuAD 基准测试中的最先进训练速度?
  • RQ4架构变化对推理延迟有何影响,特别是与 BERT 和 BiDAF 相比?
  • RQ5在阅读理解的序列建模中,通过架构简化能实现多大程度的效率提升?

主要发现

  • FastFusionNet 仅用 18 分钟 46 秒(4 个周期)就在 SQuAD 开发集上达到 75% F1,比先前 DrQA(ParlAI) 的领先模型快 45%。
  • 单样本推理延迟降低至 7.9ms,比 BERT-base 快 2.8 倍,比 BiDAF 快 12.7 倍。
  • 尽管 F1 分数与原始 FusionNet 相同(82.5%),推理时间仍比原始 FusionNet 快 5.8 倍。
  • 每个周期的训练时间比 FusionNet 快 2.6 倍,尽管模型架构其余部分保持不变。
  • 在同等 GPU(V100)条件下,FastFusionNet 的训练时间比 DrQA(ParlAI) 快 3.1 倍。
  • 全量训练后,模型保持 82.5% 的 F1 分数,与不使用 CoVe 的 FusionNet 性能相当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。