Skip to main content
QUICK REVIEW

[논문 리뷰] The Volctrans GLAT System: Non-autoregressive Translation Meets WMT21

Lihua Qian, Yi Zhou|arXiv (Cornell University)|2021. 09. 23.
Natural Language Processing Techniques참고 문헌 19인용 수 6
한 줄 요약

이 논문은 WMT21 독일어-영어 뉴스 번역 과제에서 최고 성능을 기록한 Volctrans GLAT 시스템을 제시한다. 이는 Glancing Transformer 기반의 비자기적 번역 모델로, 지식 정복, 다단계 훈련, 도메인 적응 및 다양한 특징을 활용한 재순서 정렬 전략을 결합하여, 35.0의 BLEU 점수를 달성한다. 이는 모든 자기적 기반 모델을 능가하며, 병렬 디코딩이 속도와 정확성 측면에서 자기적 방법을 능가할 수 있음을 보여준다.

ABSTRACT

This paper describes the Volctrans' submission to the WMT21 news translation shared task for German->English translation. We build a parallel (i.e., non-autoregressive) translation system using the Glancing Transformer, which enables fast and accurate parallel decoding in contrast to the currently prevailing autoregressive models. To the best of our knowledge, this is the first parallel translation system that can be scaled to such a practical scenario like WMT competition. More importantly, our parallel translation system achieves the best BLEU score (35.0) on German->English translation task, outperforming all strong autoregressive counterparts.

연구 동기 및 목표

  • WMT21 뉴스 번역 공동 과제를 위한 고성능이면서도 효율적인 비자기적 번역 시스템을 개발하기 위해.
  • 보조 디코더를 도입하여 비자기적 모델의 훈련과 추론 간 격차를 줄이기 위해.
  • 데이터 정복, 다단계 훈련 및 도메인 적응을 통해 모델 성능을 향상시키기 위해.
  • 높은 추론 속도를 유지하면서 최고의 BLEU 점수를 달성하여 자기적 모델의 우월성을 도전하기 위해.
  • 병렬 디코딩이 번역 품질 측면에서 자기적 디코딩을 능가할 수 있음을 입증하기 위해.

제안 방법

  • 시스템은 두 단계 훈련 과정을 사용하는 Glancing Transformer(GLAT) 기반으로, 먼저 병렬적으로 전체 문장을 생성한 후, 부분 예측을 마스킹하고 보정하여 훈련-추론 격차를 줄인다.
  • GLAT 디코더와 동일한 인코더를 공유하는 보조 디코더를 도입하여 다중 작업 학습을 통해 훈련을 향상시키고, 훈련과 추론 간 격차를 줄인다.
  • 큰 자기적 모델을 사용하여 합성 병렬 데이터를 생성하고, 이를 비자기적 모델 훈련에 활용함으로써 지식 정복을 적용한다.
  • 정련된 데이터를 사용하여 점진적으로 모델을 개선하는 다단계 훈련을 적용하여 일반화 및 강건성을 향상시킨다.
  • 추론 시에는 다수의 길이 후보와 함께 소음이 있는 병렬 디코딩을 사용하고, 11개의 선택된 특징을 활용해 252개 후보 중 최고의 가설을 선택하는 재순서 정렬 메커니즘을 적용한다.
  • 재순서 정렬 모델은 kbmira를 사용하여 최적화되며, 특징 그룹을 단계적으로 추가하고 newstest20에서 가중치를 조정하여 BLEU 성능을 극대화한다.

실험 결과

연구 질문

  • RQ1WMT21과 같은 대규모 실세계 번역 벤치마크에서 비자기적 번역 시스템이 자기적 모델보다 뛰어난 성능을 낼 수 있는가?
  • RQ2다단계 훈련과 결합된 지식 정복이 비자기적 모델 성능 향상에 얼마나 효과적인가?
  • RQ3도메인 적응과 보조 디코더는 비자기적 모델의 훈련-추론 격차를 어느 정도 줄일 수 있는가?
  • RQ4다양한 특징과 다수의 모델 변종을 활용한 재순서 정렬은 비자기적 시스템의 최종 번역 품질을 크게 향상시킬 수 있는가?
  • RQ5높은 추론 속도를 유지하면서도 병렬 디코딩 전략을 통해 최고 성능의 BLEU 점수를 달성할 수 있는가?

주요 결과

  • Volctrans GLAT 시스템은 WMT21 newstest21 독일어-영어 번역 세트에서 BLEU 점수 35.0을 기록하여 모든 자동적 기반 모델을 능가했다.
  • 보조 디코더는 기본 GLAT 모델 대비 약 0.6 BLEU 포인트의 성능 향상을 이뤘다.
  • 대상 단어장 데이터에 대한 지식 정복은 0.3 BLEU 향상으로 이어졌으며, 이는 데이터 활용의 효과성을 시사한다.
  • GLAT 모델에 대한 도메인 적응은 추가로 0.2 BLEU 포인트의 성과 향상을 가져왔으며, 이는 사이클 지식 정복 데이터가 이미 도메인 정보를 포함하고 있음에도 불구하고 성과를 냈다.
  • 다양한 특징과 최적화된 kbmira 가중치를 활용한 최종 재순서 정렬 단계는 성능을 0.6 BLEU 포인트 향상시켰으며, 이는 가설 재순서 정렬의 효과성을 입증한다.
  • 시스템은 비자기적 모델이 최고 성능을 달성할 수 있음을 입증하였으며, 자동적 모델이 본질적으로 번역 품질에서 열등하다는 가정을 도전했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.