Skip to main content
QUICK REVIEW

[论文解读] Double Path Networks for Sequence to Sequence Learning

Kaitao Song, Xu Tan|arXiv (Cornell University)|Jun 13, 2018
Advanced Neural Network Applications参考文献 21被引用 9
一句话总结

该论文提出用于序列到序列学习的双路径网络(DPN-S2S),通过编码器中的双路径结构与解码器中的交叉注意力门控机制,联合利用卷积神经网络(CNN)进行局部特征提取和自注意力网络(SAN)进行全局语义建模。该模型在机器翻译和文本摘要任务上达到最先进性能,相较于仅使用CNN或仅使用SAN的基线模型,BLEU分数分别提升0.46–2.96和0.74–0.99。

ABSTRACT

Encoder-decoder based Sequence to Sequence learning (S2S) has made remarkable progress in recent years. Different network architectures have been used in the encoder/decoder. Among them, Convolutional Neural Networks (CNN) and Self Attention Networks (SAN) are the prominent ones. The two architectures achieve similar performances but use very different ways to encode and decode context: CNN use convolutional layers to focus on the local connectivity of the sequence, while SAN uses self-attention layers to focus on global semantics. In this work we propose Double Path Networks for Sequence to Sequence learning (DPN-S2S), which leverage the advantages of both models by using double path information fusion. During the encoding step, we develop a double path architecture to maintain the information coming from different paths with convolutional layers and self-attention layers separately. To effectively use the encoded context, we develop a cross attention module with gating and use it to automatically pick up the information needed during the decoding step. By deeply integrating the two paths with cross attention, both types of information are combined and well exploited. Experiments show that our proposed method can significantly improve the performance of sequence to sequence learning over state-of-the-art systems.

研究动机与目标

  • 为解决单路径模型在序列到序列学习中难以同时捕捉局部与全局序列依赖关系的局限性。
  • 探索CNN与自注意力机制的融合方式,以在不增加模型复杂度的前提下提升建模能力。
  • 设计一种双路径架构,在编码与解码过程中分别保持CNN与SAN路径的独立表征。
  • 开发一种带有门控机制的交叉注意力模块,实现在解码过程中动态选择并融合来自两条路径的信息。
  • 通过实验验证CNN与SAN路径在编码器与解码器组件中的有效性。

提出的方法

  • 编码器采用两条并行路径:一条使用卷积层捕捉局部序列连接性,另一条使用自注意力层建模全局语义关系。
  • 编码器中的每条路径独立编码源序列,保留局部与全局上下文的独立表征。
  • 解码器使用带有可学习门控的交叉注意力模块,动态关注并融合来自编码器中CNN与SAN路径的特征。
  • 门控机制使解码器能够自动权衡两条路径表征在生成每个目标词时的相关性。
  • 模型采用标准序列到序列训练目标进行端到端训练,无循环结构,支持高效并行化。
  • 该架构在机器翻译(NIST, IWSLT14)与文本摘要(Gigaword)基准上进行评估。

实验结果

研究问题

  • RQ1将CNN与自注意力路径结合是否能超越单路径架构,在序列到序列建模中取得更优性能?
  • RQ2CNN与SAN路径产生的局部与全局表征在最终输出中分别发挥何种不同作用?
  • RQ3带有门控的交叉注意力机制能否在解码过程中有效融合双路径表征?
  • RQ4性能提升源于CNN与SAN的互补性,还是源于模型容量的增加?
  • RQ5在编码器与解码器中,各条路径对整体模型性能的相对贡献如何?

主要发现

  • 在NIST中文-英文翻译任务中,DPN-S2S在不同测试集上相较于基于CNN的基线模型提升0.46–2.96 BLEU,相较于基于SAN的基线模型提升0.74–0.99 BLEU。
  • 在IWSLT14德文-英文翻译与英文Gigaword文本摘要任务上,该模型达到最先进BLEU与ROUGE分数。
  • 消融实验表明,无论在编码器或解码器中移除CNN或SAN路径均导致性能下降,证实两条路径的必要性。
  • 注意力可视化显示,基于CNN的注意力头具有更高的熵(注意力分布更分散),而基于SAN的注意力头具有更低的熵(注意力更集中),验证了其角色差异。
  • 案例研究显示,DPN-S2S成功结合了CNN路径的局部细节与SAN路径的全局连贯性,生成的翻译结果比任一单路径模型更准确。
  • 交叉注意力门控机制实现了双路径特征的有效融合,解码器能动态选择来自两条表征中最相关的信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。