[논문 리뷰] Back-translation for Large-Scale Multilingual Machine Translation
이 논문은 대규모 다국어 신경 기계 번역을 위한 제약 있는 샘플링 기반 역번역 방법을 제안하며, 더 작은 어휘집과 정제된 단일 언어 영어 데이터가 성능 향상에 기여함을 입증한다. 제약 있는 샘플링을 통해 생성된 합성 데이터에 대해 반복적인 미세조정을 수행한 12억 파라미터 모델을 사용하여 WMT-21 소규모 과제에서 각각 34.96 및 33.34의 평균 spBLEU 점수로 2위를 기록하였다.
This paper illustrates our approach to the shared task on large-scale multilingual machine translation in the sixth conference on machine translation (WMT-21). This work aims to build a single multilingual translation system with a hypothesis that a universal cross-language representation leads to better multilingual translation performance. We extend the exploration of different back-translation methods from bilingual translation to multilingual translation. Better performance is obtained by the constrained sampling method, which is different from the finding of the bilingual translation. Besides, we also explore the effect of vocabularies and the amount of synthetic data. Surprisingly, the smaller size of vocabularies perform better, and the extensive monolingual English data offers a modest improvement. We submitted to both the small tasks and achieved the second place.
연구 동기 및 목표
- 저자원 환경에서 역번역 기법을 활용하여 다국어 신경 기계 번역 성능을 향상시키는 것.
- 다국어 환경에서 다양한 역번역 샘플링 전략(빔 서치, 비제약 샘플링, 제약 샘플링)의 영향을 조사하는 것.
- 어휘집 크기와 합성 단일 언어 데이터의 양이 번역 품질에 미치는 영향을 평가하는 것.
- 자원 제약 조건 하에서 모델 훈련 및 데이터 정제를 최적화하여 효율적인 구현을 도모하는 것.
- 특히 저자원 언어 쌍에 대해 대규모 다국어 번역 과제에서 높은 성능을 달성하는 것.
제안 방법
- 병렬 단일 언어 및 병렬 훈련 데이터에 대해 미세조정된 다국어 트랜스포머 모델을 사용하였으며, 합성 데이터 생성에 12억 파라미터 모델(Trans_big)을 활용하였다.
- 합성 소스 측 문장을 생성하기 위해 제약 샘플링을 적용하여, 단어 예측을 고확률 후보에 국한시켜 다양성과 품질을 향상시켰다.
- 저자원 언어 간 데이터 분포를 균형 있게 유지하기 위해 온도 스케일링을 적용하였으며, T=5로 설정하여 문장 수 기반으로 샘플링 가중치를 조정하였다.
- 합성 데이터의 품질과 통일성을 유지하기 위해 250 토큰 이하이며 소스-타겟 길이 비율이 1.8 이하인 문장에 한해 제한하였다.
- 반복적인 미세조정을 수행: 먼저 Trans_base를 병렬 데이터에 대해 미세조정한 후, 이를 통해 합성 데이터를 생성하고, 병합된 데이터에 대해 두 번째 미세조정을 수행하였다.
- 단일 언어 영어 데이터를 신중히 선별하였으며, 그 이상의 데이터는 수익 감소 효과로 인해 합성 데이터 생성에 600만 문장 이하로 제한하였다.
실험 결과
연구 질문
- RQ1빔 서치, 비제약 샘플링, 제약 샘플링과 같은 다양한 역번역 샘플링 방법이 다국어 번역 성능에 미치는 영향은 무엇인가?
- RQ2어휘집 크기를 줄이면 다국어 번역 품질이 향상되는가, 특히 저자원 환경에서 그러한 영향은 어떠한가?
- RQ3다국어 시스템에서 역번역을 위한 최적의 영어 단일 언어 데이터 양은 얼마인가?
- RQ4언어 간 유사성(예: 중앙/동유럽어군 대비 남동아시아어군)은 역번역의 효과성에 어떤 영향을 미치는가?
- RQ5대규모 사전학습 모델에서 생성된 고품질 합성 데이터는 소규모 저자원 번역 과제에서 성능 향상에 기여하는가?
주요 결과
- 이중 번역 설정과는 달리, 제약 샘플링이 빔 서치 및 비제약 샘플링을 모두 앞선 성능을 보였다.
- 더 작은 어휘집(128K)이 더 큰 어휘집(256K)보다 우수한 성능을 보였으며, 일반화 능력 향상과 노이즈 감소를 시사한다.
- 600만 문장 이상의 영어 단일 언어 문장은 추가로 제공해도 성능 향상이 미미하여 그 이하에서 수익 감소 효과가 나타남을 시사한다.
- 제약 샘플링 방법은 특히 유사한 언어를 포함한 다국어 환경에서 혼합 언어 합성 문장을 생성할 위험을 줄였다.
- 12억 파라미터 대규모 모델에서 생성한 합성 데이터에 대해 반복적인 미세조정을 수행한 결과, Small Task 2의 개발 테스트 세트에서 33.01의 spBLEU 점수를 기록하였다.
- 최종 제출 결과, WMT-21 소규모 과제에서 두 과제 모두 2위를 기록하였으며, 각각 Small Task 1과 2의 은폐 테스트 세트에서 평균 34.96 및 33.34의 spBLEU 점수를 기록하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.