Skip to main content
QUICK REVIEW

[论文解读] Dynamic Layer Aggregation for Neural Machine Translation with Routing-by-Agreement

Zi-Yi Dou, Zhaopeng Tu|arXiv (Cornell University)|Feb 15, 2019
Topic Modeling参考文献 34被引用 15
一句话总结

该论文提出了一种基于一致路由的动态层聚合方法,受胶囊网络启发,通过上下文一致度自适应地融合Transformer各层的表征,以实现神经机器翻译中的动态层融合。该方法优于静态聚合方法和原始Transformer模型,在参数效率方面,其轻量化模型在WMT14 En→De和WMT17 Zh→En任务上超越了Transformer-Big模型。

ABSTRACT

With the promising progress of deep neural networks, layer aggregation has been used to fuse information across layers in various fields, such as computer vision and machine translation. However, most of the previous methods combine layers in a static fashion in that their aggregation strategy is independent of specific hidden states. Inspired by recent progress on capsule networks, in this paper we propose to use routing-by-agreement strategies to aggregate layers dynamically. Specifically, the algorithm learns the probability of a part (individual layer representations) assigned to a whole (aggregated representations) in an iterative way and combines parts accordingly. We implement our algorithm on top of the state-of-the-art neural machine translation model TRANSFORMER and conduct experiments on the widely-used WMT14 English-German and WMT17 Chinese-English translation datasets. Experimental results across language pairs show that the proposed approach consistently outperforms the strong baseline model and a representative static aggregation model.

研究动机与目标

  • 为解决神经机器翻译中静态层聚合的局限性,即固定融合策略忽略了上下文相关的特征重要性。
  • 探究动态、上下文感知的深层表征聚合是否能够超越仅使用顶层或固定权重融合的方法,从而提升翻译性能。
  • 研究胶囊网络原理(特别是一致路由)在自然语言处理任务中的适用性,特别是神经机器翻译中的序列建模。
  • 评估迭代式路由机制是否能比静态方法更有效地提取跨层共享的活跃特征。
  • 证明动态聚合在多种语言对和序列长度下均能带来一致的性能提升。

提出的方法

  • 提出一种动态组合机制,通过前馈网络学习位置特定的聚合权重,实现对层表征的上下文感知融合。
  • 将胶囊网络中的迭代一致路由机制适配至神经机器翻译,其中每一层的隐藏状态充当一个“胶囊”,并投票生成共享表征。
  • 采用基于期望最大化(EM)的路由算法,估计输入层表征与输出聚合表征之间的一致性,迭代优化路由权重。
  • 引入一种路由过程,基于内部神经元之间的一致性计算类似注意力的权重,过滤高维共现现象,以提取显著特征。
  • 独立地将该路由机制应用于编码器和解码器堆栈,实现在每一层上的动态表征融合。
  • 通过可视化路由动态,分析特征在层间的选择与共享机制,确认特征多样性提升并有效提取了活跃特征。

实验结果

研究问题

  • RQ1动态、上下文相关的层聚合是否能够超越静态聚合方法,提升神经机器翻译性能?
  • RQ2一致路由机制是否能有效识别并融合神经机器翻译中多个层表征间的共享活跃特征?
  • RQ3胶囊网络启发的路由机制能否成功应用于神经机器翻译中的序列建模?是否带来性能增益?
  • RQ4动态聚合在不同输入序列长度和语言对下的性能表现如何?
  • RQ5一个参数更少的模型通过动态聚合是否能超越更大的基线模型的翻译质量?

主要发现

  • 所提出的动态层聚合方法在WMT14 En→De和WMT17 Zh→En翻译任务中均持续提升BLEU分数,优于原始Transformer和静态聚合基线模型。
  • 采用动态聚合的Transformer-Base在WMT14 En→De任务上达到26.62 BLEU,尽管参数量不足Transformer-Big的一半,但仍超越后者。
  • 同时在编码器和解码器中应用路由机制可获得最佳性能(26.62 BLEU),单独在任一组件中应用也优于基线模型。
  • 长度分析显示,该动态模型在所有输入长度段均保持一致的性能增益,表明对序列长度变化具有鲁棒性。
  • 可视化结果证实,随着迭代进行,路由机制显著提升了特征多样性(多样性分数:0.0 → 0.09 → 0.18),表明有效选择了活跃且共享的特征。
  • 基于EM的路由变体达到最高性能,证明迭代一致度估计在动态融合中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。