Skip to main content
QUICK REVIEW

[论文解读] Multi-Granularity Self-Attention for Neural Machine Translation

Jie Hao, Xing Wang|arXiv (Cornell University)|Sep 5, 2019
Natural Language Processing Techniques参考文献 33被引用 9
一句话总结

本文提出多粒度自注意力(Mg-Sa),一种新颖的注意力机制,通过为n-gram和句法短语专门设置注意力头,显式建模短语级模式,从而提升基于Transformer的神经机器翻译性能。该方法在WMT14 En→De和NIST Zh→En基准上均提升了翻译性能,通过捕捉多层次短语结构,同时保持了自注意力机制的灵活性。

ABSTRACT

Current state-of-the-art neural machine translation (NMT) uses a deep multi-head self-attention network with no explicit phrase information. However, prior work on statistical machine translation has shown that extending the basic translation unit from words to phrases has produced substantial improvements, suggesting the possibility of improving NMT performance from explicit modeling of phrases. In this work, we present multi-granularity self-attention (Mg-Sa): a neural network that combines multi-head self-attention and phrase modeling. Specifically, we train several attention heads to attend to phrases in either n-gram or syntactic formalism. Moreover, we exploit interactions among phrases to enhance the strength of structure modeling - a commonly-cited weakness of self-attention. Experimental results on WMT14 English-to-German and NIST Chinese-to-English translation tasks show the proposed approach consistently improves performance. Targeted linguistic analysis reveals that Mg-Sa indeed captures useful phrase information at various levels of granularities.

研究动机与目标

  • 解决标准多头自注意力在捕捉短语级依赖关系方面的局限性,因为此类依赖关系已被证明可提升统计和神经机器翻译系统的表现。
  • 探究Transformer中未被充分利用的注意力头是否可被重新用于显式短语建模,同时不牺牲模型效率。
  • 将表层n-gram与句法引导的短语整合到注意力机制中,以增强结构建模能力。
  • 通过探针任务评估模型是否能捕捉并保留多粒度的短语级信息。
  • 通过在单语短语预测任务上的测试,证明Mg-Sa在机器翻译之外的泛化能力。

提出的方法

  • 模型引入专门的注意力头,使其关注短语片段而非单个词元,其中短语被定义为连续的n-gram(如2-gram、3-gram)或从依存树中提取的句法成分。
  • 通过在不同粒度下将输入序列划分为重叠或非重叠的片段,生成短语表示,并为这些片段分配特定的注意力头进行关注。
  • 通过允许注意力头跨短语边界进行关注,引入短语之间的交互,从而增强结构建模能力。
  • 采用点积注意力并结合缩放余弦相似度,在保持标准Transformer架构的同时,仅修改注意力头对短语级输入的行为。
  • 通过端到端翻译任务和探针任务对方法进行评估,探针任务用于测试模型预测短语级标签(如词性、时态、语态)的能力。
  • 通过依存句法分析进行句法短语生成,提取的成分结构随后作为专用注意力头的输入。

实验结果

研究问题

  • RQ1Transformer中的专用注意力头是否可有效重新用于建模短语级模式,从而提升翻译性能?
  • RQ2结合n-gram与句法短语表示是否能比标准自注意力实现更优的结构建模?
  • RQ3Mg-Sa在多大程度上能捕捉并保留多粒度短语信息,通过探针任务进行衡量?
  • RQ4Mg-Sa在多种语言对和任务上的性能与强基线Transformer相比如何?
  • RQ5Mg-Sa中短语建模的优势是否可泛化到机器翻译之外的任务,例如单语短语预测任务?

主要发现

  • 所提出的Mg-Sa模型在WMT14英语→德语和NIST中文→英语翻译任务上,均持续优于标准Transformer基线模型。
  • 采用句法短语(如基于依存的成分)的模型优于仅使用n-gram或不进行短语建模的模型,表明结构信息具有显著价值。
  • 在探针任务中,Mg-Sa模型在预测短语级标签(如词性、时态、语态、SPC)方面显著优于基线NMT编码器,尤其在细粒度粒度下表现更优。
  • 从零开始训练时,Mg-Sa在较大短语级任务(如TSS、时态、语态)上表现出更大提升,表明其具备有效的长程短语表征学习能力。
  • 模型保持了高效率,推理速度仅比标准Transformer略有增加,表明其集成轻量化。
  • 语言学分析证实,Mg-Sa成功捕捉并存储了多粒度的短语级信息,验证了其设计初衷。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。