Skip to main content
QUICK REVIEW

[论文解读] Phrase-Based Attentions

Phi Xuan Nguyen, Shafiq Joty|arXiv (Cornell University)|Sep 30, 2018
Topic Modeling参考文献 16被引用 10
一句话总结

本文提出基于短语的注意力机制,将Transformer模型扩展为可关注n-gram短语而非仅标记(token),从而实现更鲁棒的短语对齐。通过引入新型注意力结构——ConvKV、QueryK以及交错异构注意力,这些方法在WMT'14英语-德语和德语-英语基准上分别将翻译性能提升1.3 BLEU和0.5 BLEU。

ABSTRACT

Most state-of-the-art neural machine translation systems, despite being different in architectural skeletons (e.g. recurrence, convolutional), share an indispensable feature: the Attention. However, most existing attention methods are token-based and ignore the importance of phrasal alignments, the key ingredient for the success of phrase-based statistical machine translation. In this paper, we propose novel phrase-based attention methods to model n-grams of tokens as attention entities. We incorporate our phrase-based attentions into the recently proposed Transformer network, and demonstrate that our approach yields improvements of 1.3 BLEU for English-to-German and 0.5 BLEU for German-to-English translation tasks on WMT newstest2014 using WMT'16 training data.

研究动机与目标

  • 解决神经机器翻译中基于标记的注意力机制的局限性,该机制忽略了短语对齐在短语级统计机器翻译中的关键作用。
  • 将短语对齐整合到最先进的Transformer模型中,以更好地捕捉组合性与非组合性短语。
  • 设计支持全部四种映射类型的注意力机制:标记到标记、标记到短语、短语到标记和短语到短语。
  • 证明基于短语的注意力可超越标准基于标记的注意力,在端到端神经机器翻译中提升翻译质量。
  • 通过跨层建模短语级依赖关系,实现更可解释且更鲁棒的注意力模式。

提出的方法

  • 提出两种核心的基于短语的注意力机制:ConvKV,利用卷积核生成基于短语的键和值;以及QueryK,学习基于短语的查询表征。
  • 设计三种注意力结构:同构(查询与键使用相同n-gram类型)、异构(混合n-gram类型)以及交错异构(统一框架支持全部四种映射类型)。
  • 将基于短语的注意力机制集成到Transformer的所有多头注意力层中,同时保留原始架构的自注意力与交叉注意力机制。
  • 使用可学习参数从标记嵌入生成短语表征,使注意力能够关注可变长度的n-gram。
  • 对基于短语的注意力分数应用softmax归一化,以保持与标准注意力计算的兼容性。
  • 使用WMT’16训练数据,通过标准神经机器翻译目标与交叉熵损失进行端到端训练。

实验结果

研究问题

  • RQ1基于短语的注意力机制是否能通过显式建模n-gram对齐来提升神经机器翻译性能?
  • RQ2在捕捉多样化短语对齐模式方面,不同注意力结构(同构、异构、交错)的表现如何比较?
  • RQ3与基于标记的注意力相比,引入基于短语的注意力是否能带来更可解释或更鲁棒的注意力分布?
  • RQ4在Transformer的哪些层中,短语到短语及其他短语级注意力模式最为显著?
  • RQ5仅通过修改注意力机制,无需架构整体重构,基于短语的注意力是否能提升BLEU分数?

主要发现

  • 交错异构注意力机制表现最佳,实现英语-德语翻译任务+1.33 BLEU和德语-英语翻译任务+0.48 BLEU的提升。
  • 短语到短语注意力在中间层(如第3层)最为活跃,占注意力激活的96.16%,表明短语级对齐在网络中早期即被学习。
  • 在顶层(如第6层),标记到标记注意力占主导地位,与按顺序生成标记的自回归生成过程一致。
  • 异构模型优于同构模型,尤其在引入三元组(trigram)成分时表现更优,表明灵活选择n-gram类型可减少无关对齐带来的噪声。
  • 在交错和异构设置中,QueryK优于ConvKV,表明可学习的短语查询比固定卷积核生成的键更有效。
  • 注意力机制成功地在各层之间实现从短语级到标记级注意力的过渡,反映出Transformer中分层处理的模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。