Skip to main content
QUICK REVIEW

[论文解读] Monotonic Multihead Attention

Xutai Ma, Juan Pino|arXiv (Cornell University)|Sep 26, 2019
Topic Modeling参考文献 17被引用 68
一句话总结

本论文引入 Monotonic Multihead Attention (MMA),将单调注意力扩展到基于 Transformer 的模型以实现同步翻译,提出两种变体(MMA-H 和 MMA-IL),并通过时延控制损失在 MILk 的质时权衡上实现改进。

ABSTRACT

Simultaneous machine translation models start generating a target sequence before they have encoded or read the source sequence. Recent approaches for this task either apply a fixed policy on a state-of-the art Transformer model, or a learnable monotonic attention on a weaker recurrent neural network-based structure. In this paper, we propose a new attention mechanism, Monotonic Multihead Attention (MMA), which extends the monotonic attention mechanism to multihead attention. We also introduce two novel and interpretable approaches for latency control that are specifically designed for multiple attentions heads. We apply MMA to the simultaneous machine translation task and demonstrate better latency-quality tradeoffs compared to MILk, the previous state-of-the-art approach. We also analyze how the latency controls affect the attention span and we motivate the introduction of our model by analyzing the effect of the number of decoder layers and heads on quality and latency.

研究动机与目标

  • 通过使 Transformer 模型在不读取完整源文本的情况下在线解码来推动在线/实时翻译。
  • 开发支持多个解码头和层的单调注意力机制。
  • 引入时延控制策略以管理跨头部和层的读取/写入时间表。
  • 在标准基准上展示相对于 MILk 的更优时延-质量权衡。
  • 提供消融分析以分析解码器深度、头数以及提出的损失项对性能的影响。

提出的方法

  • 将 MMA 定义为在每个解码器层中的逐头单调注意力,使跨层能够并行独立的注意力头(MMA-H 和 MMA-IL)。
  • 通过在每层每个头使用带 Sigmoid 的单调能量和 Bernoulli 采样来计算选择概率 p_{i,j}^{l,h}。
  • 使用两种变体:MMA-H(具有每头硬对齐的硬注意力)和 MMA-IL(带有每头 Softmax 能量的无限回溯)。
  • 将每头的上下文聚合成每层的拼接上下文并输入相应的解码块。
  • 引入时延正则项:一个可微分的基于平均滞后损失 L_avg 和一个头发散损失 L_var,以控制读取速度和跨头方差。
  • 以结合翻译损失与 λ_avg L_avg 和 λ_var L_var 的目标函数进行训练,以在质量和时延之间取得平衡。

实验结果

研究问题

  • RQ1单调注意力能否扩展到多头 Transformer 架构以实现在线解码而不牺牲翻译质量?
  • RQ2每头的时延控制如何影响 MMA 中的注意力跨度和总体时延?
  • RQ3MMA-H 和 MMA-IL 是否提供不同的质量-时延权衡,并在何种条件下?
  • RQ4解码器层数和头数对 MMA 的质量和时延有何影响?
  • RQ5时延控制损失是否能够有效防止异常头主导读取速度?

主要发现

  • 在 IWSLT15 En-Vi 和 WMT15 De-En 基准上,MMA 取得比 MILk 更好的时延-质量权衡。
  • 尽管每个头只关注一个状态,MMA-H 在时延-质量 Pareto frontier 上通常优于 MILk。
  • 可微分的时延损失有效地降低注意力跨度并平衡头部速度,随着 L_var 增大平均注意力跨度变短所示。
  • 增加解码器层数和头数通常会改善 BLEU 但会增加时延,指示存在权衡并需要调整 λ 参数。
  • 所提出的损失影响读取缓冲区和头部多样性,降低了由异常头引起的延迟。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。