Skip to main content
QUICK REVIEW

[论文解读] Deep Neural Machine Translation with Linear Associative Unit

Mingxuan Wang, Zhengdong Lu|arXiv (Cornell University)|May 2, 2017
Natural Language Processing Techniques参考文献 24被引用 14
一句话总结

本文提出线性关联单元(LAU),一种新型循环神经网络单元,通过融合线性与非线性变换,实现时间与空间维度上的无阻碍梯度流动。由此产生的DeepLAU模型在中英翻译任务上达到最先进性能(较Groundhog提升11.7 BLEU),在英德与英法WMT14任务上也取得具有竞争力的结果,证明其在深层架构中具备更优的训练稳定性和性能表现。

ABSTRACT

Deep Neural Networks (DNNs) have provably enhanced the state-of-the-art Neural Machine Translation (NMT) with their capability in modeling complex functions and capturing complex linguistic structures. However NMT systems with deep architecture in their encoder or decoder RNNs often suffer from severe gradient diffusion due to the non-linear recurrent activations, which often make the optimization much more difficult. To address this problem we propose novel linear associative units (LAU) to reduce the gradient propagation length inside the recurrent unit. Different from conventional approaches (LSTM unit and GRU), LAUs utilizes linear associative connections between input and output of the recurrent unit, which allows unimpeded information flow through both space and time direction. The model is quite simple, but it is surprisingly effective. Our empirical study on Chinese-English translation shows that our model with proper configuration can improve by 11.7 BLEU upon Groundhog and the best reported results in the same setting. On WMT14 English-German task and a larger WMT14 English-French task, our model achieves comparable results with the state-of-the-art.

研究动机与目标

  • 解决用于神经机器翻译的深层循环神经网络中的梯度消失问题。
  • 缩短循环单元内部的梯度路径长度,以改善深层编码器-解码器架构的优化效果。
  • 设计一种简单而高效的循环单元,支持更深网络而不会导致性能下降。
  • 在使用更深模型的情况下,于主要神经机器翻译基准测试中实现最先进或具有竞争力的结果。
  • 证明当与高效的梯度流动结合时,深度相较于宽度对建模复杂语言结构更具优势。

提出的方法

  • 提出线性关联单元(LAU),在循环单元内融合线性与非线性变换,以实现信息的直接流动。
  • LAU在输入与隐藏状态之间计算线性组合,同时应用非线性变换,从而支持捷径路径与序列路径并行存在。
  • 该架构实现了时间与空间维度上的无阻碍梯度传播,有效缓解梯度消失问题。
  • 采用配备LAU的深层编码器与解码器,实现更深堆叠而不会引发优化崩溃。
  • 使用标准注意力机制与基于交叉熵损失的序列到序列训练方法。
  • 通过标准神经机器翻译基准(包括NIST中英翻译与WMT14英德/英法任务)上的BLEU分数评估模型性能。

实验结果

研究问题

  • RQ1新型循环单元设计是否能缩短梯度路径长度,并提升深层神经机器翻译模型的训练稳定性?
  • RQ2在循环单元中启用直接线性信息流,是否能提升长句与复杂句上的模型性能?
  • RQ3在参数量更少的情况下,采用LAU的深层网络是否仍能超越浅层模型?
  • RQ4在BLEU分数与训练稳定性方面,LAU相较于残差连接与前馈连接有何差异?
  • RQ5相较于宽度,模型深度在神经机器翻译中对性能提升的贡献程度如何?

主要发现

  • 在NIST中英翻译任务上,DeepLAU相较Groundhog提升11.7 BLEU,较采用标准技术的强基线模型提升4.9 BLEU。
  • 在8层编码器与6层解码器设置下,DeepLAU取得39.01的BLEU分数,优于DeepGRU及其他基线模型。
  • 即使参数量更少,采用深度结构(8,6)的DeepLAU仍优于更宽的DeepGRU模型,表明深度比宽度更具优势。
  • 在WMT14英德与英法任务上,DeepLAU取得与最先进模型相当的结果。
  • 在长句上,DeepLAU保持性能优势,所有长度区间内的BLEU分数均持续高于DeepGRU。
  • 该模型在极端深度(如编码器8层)下仍保持稳定训练,而标准DeepGRU模型性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。