Skip to main content
QUICK REVIEW

[논문 리뷰] Monotonic Multihead Attention

Xutai Ma, Juan Pino|arXiv (Cornell University)|2019. 09. 26.
Topic Modeling참고 문헌 17인용 수 68
한 줄 요약

본 논문은 Monotonic Multihead Attention(MMA)를 제시하여 단조로운(attentional) 어텐션을 Transformer 기반 모델의 동시 번역에 확장하고, 두 가지 변형(MMA-H 및 MMA-IL)과 MILk 대비 품질-지연 trade-off를 개선하기 위한 대기시간 제어 손실을 도입한다.

ABSTRACT

Simultaneous machine translation models start generating a target sequence before they have encoded or read the source sequence. Recent approaches for this task either apply a fixed policy on a state-of-the art Transformer model, or a learnable monotonic attention on a weaker recurrent neural network-based structure. In this paper, we propose a new attention mechanism, Monotonic Multihead Attention (MMA), which extends the monotonic attention mechanism to multihead attention. We also introduce two novel and interpretable approaches for latency control that are specifically designed for multiple attentions heads. We apply MMA to the simultaneous machine translation task and demonstrate better latency-quality tradeoffs compared to MILk, the previous state-of-the-art approach. We also analyze how the latency controls affect the attention span and we motivate the introduction of our model by analyzing the effect of the number of decoder layers and heads on quality and latency.

연구 동기 및 목표

  • 전체 소스를 읽지 않고도 온라인에서 디코딩할 수 있도록 Transformer 모델을 가능하게 하여 온라인/실시간 번역을 촉진한다.
  • 여러 디코더 헤드와 계층을 지원하는 단조로운(monotonic) 어텐션 메커니즘을 개발한다.
  • 헤드 및 계층 간의 읽기/쓰기 스케줄을 관리하기 위한 지연 제어 전략을 도입한다.
  • 표준 벤치마크에서 MILk 대비 우수한 지연-품질 trade-off를 입증한다.
  • 성능에 대한 디코더 깊이, 헤드 수 및 제안된 손실 항의 영향을 분석하는 ablation 연구를 제공한다.

제안 방법

  • 각 디코더 계층에서 헤드당 단조로운(attention) 어텐션으로 MMA를 정의하고, 계층 간의 독립적인 어텐션 헤드를 병렬로 가능하게 한다(MMA-H 및 MMA-IL).
  • 각 계층의 각 헤드에 대해 시그모이드와 Bernoulli 샘플링을 이용한 단조 에너지를 통해 선택 확률 p_{i,j}^{l,h}를 계산한다.
  • 두 가지 변형을 사용한다: MMA-H(헤드별 하드 얼라인먼트가 있는 하드 어텐션)와 MMA-IL(헤드별 소프트맥스 에너지를 활용한 무한한 되돌아보기).
  • 각 계층의 헤드별 컨텍스트를 연결된 컨텍스트로 집계하여 각 디코더 블록에 입력으로 제공한다.
  • 읽기 속도와 교차 헤드 분산을 제어하기 위한 differentiable 평균 지연 기반 손실 L_avg와 헤드 분산 손실 L_var를 도입한다.
  • 품질과 지연의 균형을 맞추기 위해 번역 손실과 λ_avg L_avg 및 λ_var L_var를 결합한 목적 함수로 학습한다.

실험 결과

연구 질문

  • RQ1단조 어텐션을 다중 헤드 Transformer 아키텍처에 확장하여 온라인 디코딩을 수행하되 번역 품질을 희생하지 않을 수 있는가?
  • RQ2헤드별 지연 제어가 MMA에서 어텐션 스팬과 전체 지연에 어떤 영향을 미치는가?
  • RQ3MMA-H와 MMA-IL이 서로 다른 품질-지연 trade-off를 제공하는가, 그리고 어떤 조건에서인가?
  • RQ4MMA에서 디코더 계층 수와 헤드 수가 품질과 지연에 미치는 영향은 무엇인가?
  • RQ5지연 제어 손실이 실제로 편향된(outlier) 헤드가 읽기 속도를 지배하는 것을 효과적으로 방지하는가?

주요 결과

  • MMA는 IWSLT15 En-Vi 및 WMT15 De-En 벤치마크에서 MILk보다 나은 지연-품질 trade-off를 달성한다.
  • 각 헤드가 단일 상태에 주목하더라도 MMA-H는 지연-품질 파레토 프런티어에서 종종 MILk를 능가한다.
  • 연속 미분 가능한 지연 손실은 실제로 어텐션 스팬을 줄이고 헤드 속도를 균형 있게 하며, L_var 증가에 따라 평균 어텐션 스팬이 짧아짐으로써 이를 보여준다.
  • 디코더 계층 수와 헤드 수를 늘리면 일반적으로 BLEU가 향상되지만 지연도 증가하므로 trade-off를 시사하며 λ 매개변수의 조정이 필요하다.
  • 제안된 손실들이 읽기 버퍼와 헤드 다양성에 영향을 주어 outlierHead에 의한 지연을 줄인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.