Skip to main content
QUICK REVIEW

[논문 리뷰] LAVA NAT: A Non-Autoregressive Translation Model with Look-Around Decoding and Vocabulary Attention

Xiaoya Li, Yuxian Meng|arXiv (Cornell University)|2020. 02. 08.
Topic Modeling참고 문헌 29인용 수 11
한 줄 요약

이 논문은 LAVA NAT를 제안하며, 이는 Look-Around 디코딩과 Vocabulary Attention을 사용하여 NAT 모델에서 발생하는 다중모달성 문제를 해결하는 비자기적 번역 모델이다. 인접한 토큰을 예측하고 전체 어휘에 주목함으로써 LAVA NAT는 자동회귀 모델 대비 최대 20.18배 빠른 추론 속도를 기록하면서도 경쟁 가능한 BLEU 점수를 달성하여 지연 시간을 크게 줄이고 번역 품질을 향상시킨다.

ABSTRACT

Non-autoregressive translation (NAT) models generate multiple tokens in one forward pass and is highly efficient at inference stage compared with autoregressive translation (AT) methods. However, NAT models often suffer from the multimodality problem, i.e., generating duplicated tokens or missing tokens. In this paper, we propose two novel methods to address this issue, the Look-Around (LA) strategy and the Vocabulary Attention (VA) mechanism. The Look-Around strategy predicts the neighbor tokens in order to predict the current token, and the Vocabulary Attention models long-term token dependencies inside the decoder by attending the whole vocabulary for each position to acquire knowledge of which token is about to generate. %We also propose a dynamic bidirectional decoding approach to accelerate the inference process of the LAVA model while preserving the high-quality of the generated output. Our proposed model uses significantly less time during inference compared with autoregressive models and most other NAT models. Our experiments on four benchmarks (WMT14 En$ ightarrow$De, WMT14 De$ ightarrow$En, WMT16 Ro$ ightarrow$En and IWSLT14 De$ ightarrow$En) show that the proposed model achieves competitive performance compared with the state-of-the-art non-autoregressive and autoregressive models while significantly reducing the time cost in inference phase.

연구 동기 및 목표

  • 비자기적 번역(NAT)에서 토큰 독립성과 위치 모델링의 열악함으로 인해 반복되거나 누락된 토큰을 생성하는 다중모달성 문제를 해결하기 위해.
  • 이웃 토큰을 활용하여 현재 토큰 예측에 도움을 주는 새로운 Look-Around 디코딩 전략을 도입함으로써 NAT의 토큰 수준 및 위치 수준의 종속성을 향상시키기 위해.
  • 맥락적 신호에 기반해 각 디코더 위치가 전체 어휘를 주목할 수 있도록 해서 장거리 토큰 종속성을 향상시키고 토큰 선택 정확도를 높이기 위해.
  • 기타 NAT 모델들과 유사한 추론 속도를 확보하면서도 최신 자동회귀 및 비자기적 모델의 성능을 따라하거나 초월하는 성능을 달성하기 위해.

제안 방법

  • Look-Around(LA) 디코딩은 현재 토큰 예측을 도와주기 위해 왼쪽과 오른쪽 이웃 토큰을 동시에 예측함으로써 위치-토큰 불일치를 줄이고 국소적인 단어 순서 모델링을 향상시킨다.
  • 어휘 주목(VA)은 각 디코더 레이어가 각 위치에서 전체 어휘 항목에 주목할 수 있도록 해서 장기적 종속성을 포착하고 토큰 선택 정확도를 향상시킨다.
  • 동적 양방향 디코딩 전략이 도입되어, 왼쪽에서 오른쪽과 오른쪽에서 왼쪽 방향으로의 디코딩을 번갈아가며 예측을 반복적으로 개선할 수 있도록 한다.
  • 노출 편향을 줄이고 일반화 능력을 향상시키기 위해 훈련 중에 미분 가능한 스케줄링 샘플링(DSS)을 사용한다.
  • 프레임워크는 교차 엔트로피 손실을 사용해 엔드 투 엔드로 훈련되며, 생성 품질 향상을 위해 동적 디코딩 스케줄을 사용해 미세조정된다.
  • 아키텍처는 LA와 VA를 표준 Transformer 기반 디코더에 통합하여 한 번의 통과로 추론 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1디코딩 중 이웃 토큰을 모델링하면 비자기적 번역의 정확성과 유창성이 향상되는가?
  • RQ2각 디코더 위치에서 전체 어휘에 주목함으로써 모델이 다양하고 정확한 목표 토큰을 생성하는 데 영향을 미치는가?
  • RQ3양방향 맥락과 어휘 주목을 조합하면 단방향 또는 독립적인 토큰 생성보다 더 높은 성능을 내는가?
  • RQ4비자기적 모델이 자동회귀 모델과 유사한 성능을 달성하면서도 높은 추론 속도를 유지할 수 있는가?
  • RQ5동적 양방향 디코딩 전략은 BLEU 점수와 추론 속도 측면에서 탐욕적 및 빔 서치와 비교해 어떻게 다른가?

주요 결과

  • WMT14 En→De에서 LAVA NAT는 양방향 Look-Around를 사용할 경우 표준 NAT보다 +9 BLEU 포인트 향상되어 기준 NAT를 크게 앞서며 성능을 뛰어나게 한다.
  • IWSLT14 De→En에서 모델은 자동회귀 Transformer 대비 20.18배 빠른 속도로 33.59의 BLEU 점수를 기록하여 높은 효율성과 정확도를 입증한다.
  • Look-Around 메커니즘은 다양한 NAT 모델에서 성능 향상을 이끌었으며, IWSLT14 De→En에서 +0.55에서 +1.16 BLEU 포인트의 향상이 관찰되었다.
  • 미분 가능한 스케줄링 샘플링(DSS)은 훈련 전략 중에서 가장 높은 성능을 보였으며, 티처 포싱과 표준 스케줄링 샘플링을 모두 앞선다.
  • LAVA NAT는 문장 길이에 관계없이 안정적인 성능을 유지하는 반면, 표준 NAT 모델은 긴 문장에서 성능이 크게 떨어지는 경향이 있다.
  • qualitative 예시에서 반복 토큰이 없는 번역을 생성하고 기준 번역과 높은 일관성을 유지함을 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.