Skip to main content
QUICK REVIEW

[论文解读] Lattice-Based Transformer Encoder for Neural Machine Translation

Fengshun Xiao, Jiangtong Li|arXiv (Cornell University)|Jun 4, 2019
Natural Language Processing Techniques参考文献 49被引用 9
一句话总结

本文提出基于格子的编码器用于神经机器翻译中的Transformer模型,引入格子位置编码(LPE)和格子感知自注意力(LSA),以整合多种词或子词分词结果。当两者结合时,翻译性能提升0.91 BLEU分,参数量增加极少,训练效率仅中度下降,证明在词级别和子词级别表示上均具有效性。

ABSTRACT

Neural machine translation (NMT) takes deterministic sequences for source representations. However, either word-level or subword-level segmentations have multiple choices to split a source sequence with different word segmentors or different subword vocabulary sizes. We hypothesize that the diversity in segmentations may affect the NMT performance. To integrate different segmentations with the state-of-the-art NMT model, Transformer, we propose lattice-based encoders to explore effective word or subword representation in an automatic way during training. We propose two methods: 1) lattice positional encoding and 2) lattice-aware self-attention. These two methods can be used together and show complementary to each other to further improve translation performance. Experiment results show superiorities of lattice-based encoders in word-level and subword-level representations over conventional Transformer encoder.

研究动机与目标

  • 解决神经机器翻译中确定性分词带来的源表示多样性受限问题。
  • 在不牺牲并行计算的前提下,将多种词或子词分词结果整合进Transformer编码器。
  • 开发与Transformer中自注意力和位置编码兼容的格子感知机制。
  • 评估基于格子的方法在神经机器翻译中词级别和子词级别表示上的有效性。
  • 在通过格子整合提升翻译质量的同时,保持训练效率。

提出的方法

  • 提出格子位置编码(LPE),根据输入序列中边的相对顺序,为格子边分配位置编码。
  • 引入格子感知自注意力(LSA),通过修改注意力计算过程,考虑格子边之间的结构关系。
  • 使用格子图结构将多种分词假设表示为有向边,以保留分词多样性。
  • 在修改后的Transformer架构中应用残差连接和层归一化,以维持训练稳定性。
  • 结合LPE与LSA,以同时利用长距离位置顺序信息与局部邻接关系信息。
  • 采用标准多头自注意力机制,但通过修改注意力得分以考虑格子边的关系与位置。

实验结果

研究问题

  • RQ1基于格子的表示能否通过捕捉多样化的分词选择,提升基于Transformer的神经机器翻译性能?
  • RQ2如何有效将格子结构整合进Transformer的自注意力机制中?
  • RQ3格子位置编码是否能增强对非线性格子结构中序列顺序的建模能力?
  • RQ4LPE与LSA在提升翻译性能方面,其互补性达到何种程度?
  • RQ5基于格子的方法能否在提升翻译质量的同时保持训练效率?

主要发现

  • 在IWSLT2016 En-De数据集上,LPE与LSA联合使用使翻译性能提升0.91 BLEU分,优于基础Transformer模型。
  • 在NIST Zh-En数据集上,LPE单独使用使BLEU提升0.39分,LSA使BLEU提升0.23分,均优于标准位置编码。
  • LPE+LSA模型在tst2014上的BLEU得分为30.28,相较于最佳基线模型具有统计显著性提升(p < 0.01)。
  • 基于格子的模型仅比基础Transformer多出6k个参数,表明参数开销极低。
  • 训练速度从0.714降至0.328步/秒,尽管格子结构增加了复杂性,但效率损失仅为中等程度。
  • 该方法在词级别和子词级别分词上均有效,展现出广泛的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。