Skip to main content
QUICK REVIEW

[논문 리뷰] Multilingual Machine Translation Systems from Microsoft for WMT21 Shared Task

Jian Yang, Shuming Ma|arXiv (Cornell University)|2021. 11. 03.
Natural Language Processing Techniques참고 문헌 27인용 수 15
한 줄 요약

이 논문은 WMT21 공동 과제를 위한 마이크로소프트의 다국어 기계 번역 시스템을 제시한다. 이 시스템은 사전 훈련된 DeltaLM-Large 모델을 기반으로 하며, 대규모 다국어 데이터로 미세조정하고, 점진적 학습과 반복적 역번역을 적용하여 성능을 향상시킨다. 시스템은 자동 평가 지표 기준으로 모든 세 가지 평가 트랙에서 최상위 성능을 기록하여 최신 기술 수준(SOTA)을 달성했다.

ABSTRACT

This report describes Microsoft's machine translation systems for the WMT21 shared task on large-scale multilingual machine translation. We participated in all three evaluation tracks including Large Track and two Small Tracks where the former one is unconstrained and the latter two are fully constrained. Our model submissions to the shared task were initialized with DeltaLM\footnote{\url{https://aka.ms/deltalm}}, a generic pre-trained multilingual encoder-decoder model, and fine-tuned correspondingly with the vast collected parallel data and allowed data sources according to track settings, together with applying progressive learning and iterative back-translation approaches to further improve the performance. Our final submissions ranked first on three tracks in terms of the automatic evaluation metric.

연구 동기 및 목표

  • 대규모 다국어 데이터를 활용하여 WMT21 공동 과제를 위한 고성능 다국어 기계 번역 시스템을 개발하기 위해.
  • 점진적 미세조정과 반복적 역번역이 다국어 번역 성능 향상에 얼마나 효과적인지 조사하기 위해.
  • Zero-shot 및 저자원 번역 방향에서 사전 훈련된 다국어 모델(예: DeltaLM)의 영향을 탐색하기 위해.
  • 제한된 계산 자원 조건 하에서 모델 용량과 훈련 효율성을 최적화하기 위해.
  • 제약 없는 및 완전히 제약된 평가 트랙에서 다국어 번역 분야에서 최고 성과를 내기 위해.

제안 방법

  • 시스템은 공개된 DeltaLM-Large 사전 훈련된 인코더-디코더 모델로 초기화되며, CCAligned, OPUS-100, 내부 데이터 등 다양한 출처의 대규모 다국어 병렬 데이터로 미세조정된다.
  • 점진적 학습은 먼저 24개의 인코더 레이어를 가진 얕은 모델로 훈련한 후, 12개의 새로운 레이어를 추가하여 36개의 인코더 레이어를 가진 깊은 모델로 확장함으로써 적용된다.
  • 반복적 역번역은 단방향 데이터를 기반으로 합성 병렬 데이터를 생성하기 위해 사용되며, 단방향 데이터에 대해 다중 라운드의 역번역을 적용하여 데이터 품질과 커버리지 향상을 도모한다.
  • 이중-가짜 병렬 데이터는 동일한 영어 단문을 여러 목표 언어로 번역하여 구성되며, 비영어 방향의 데이터 다양성을 증가시킨다.
  • 소형 트랙 #2에서는 직접 번역이 피벗 기반 번역(영어를 통한 중간 번역)보다 성능이 뛰어날 경우 직접 번역을 사용하고, 그렇지 않으면 피벗 번역을 선택하는 하이브리드 번역 전략을 채택한다.
  • 모델 선택은 추론 속도와 성능의 균형을 고려하여 이루어지며, 대형 트랙과 소형 트랙 #2에는 24개의 인코더 레이어 모델을, 소형 트랙 #1에는 36개의 인코더 레이어 모델을 제출했다.

실험 결과

연구 질문

  • RQ1대규모 설정에서 DeltaLM-Large 사전 훈련 모델이 다국어 번역 기반 모델로 얼마나 효과적인가?
  • RQ2얕은 아키텍처에서 깊은 아키텍처로 확장할 때 점진적 학습이 모델 성능 향상에 얼마나 기여하는가?
  • RQ3반복적 역번역이 특히 저자원 언어 쌍에 대해 번역 품질 향상에 상당한 기여를 할 수 있는가?
  • RQ4이중-가짜 데이터 생성 방식이 다국어 번역에서 성능 향상에 기여하는 방식, 특히 비영어 언어에 대해 어떻게 작용하는가?
  • RQ5저자원 번역 방향에서 불균형 데이터를 처리하기 위한 최적의 전략은 직접 번역인지, 피벗 기반 번역인지?

주요 결과

  • 최종 시스템인 DeltaLM + Zcode는 대형 트랙에서 BLEU 점수 16.63을 기록하여 모든 제출물 중 1위를 차지했다.
  • 소형 트랙 #1에서 시스템은 BLEU 점수 37.59를 기록하여 해당 트랙에서 모든 참가자 중 최고 성능을 달성했다.
  • 소형 트랙 #2에서는 BLEU 점수 33.89를 기록하여, 더 작은 훈련 데이터와 더 불균형한 데이터를 바탕으로 하더라도 다시 한 번 1위를 확보했다.
  • 제거 실험 결과 각 구성 요소(점진적 학습, 데이터 선택, 모델 깊이)가 상당한 기여를 했으며, 전체 시스템(①)은 베이스라인 대비 +9.41 BLEU 포인트 향상된 성능을 기록했다.
  • 소형 트랙 #2의 하이브리드 전략은 직접 번역 또는 피벗 번역 전용 방법 대비 약 +0.5 BLEU 포인트 향상된 성능을 기록하여, 불균형 데이터 처리에 효과적임을 확인했다.
  • 깊은 모델(36개의 인코더 레이어)은 얕은 모델(24개의 인코더 레이어)과 유사한 성능을 기록했으며, 이는 증가한 용량에도 불구하고 저자원 방향에서 과적합 가능성의 징후로 해석될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.