[논문 리뷰] SJTU-NICT's Supervised and Unsupervised Neural Machine Translation Systems for the WMT20 News Translation Task
이 논문은 WMT20 뉴스 번역 과제를 위한 SJTU-NICT의 신경 기계 번역 시스템을 제시하며, 문서 증강 NMT, XLM 미사전학습, 이방향 번역, 기준 언어 기반 UNMT, 데이터 의존성 가우시안 사전 확률 목적함수, BT-BLEU 공동 필터링 기반의 자기학습 기법을 포함한 다양한 기법을 활용한다. 이들의 시스템은 영어-중국어, 폴란드어-영어, 독일어-위어르술란어 번역 방향에서 최상의 성능을 기록하여 1위를 차지하였다.
In this paper, we introduced our joint team SJTU-NICT 's participation in the WMT 2020 machine translation shared task. In this shared task, we participated in four translation directions of three language pairs: English-Chinese, English-Polish on supervised machine translation track, German-Upper Sorbian on low-resource and unsupervised machine translation tracks. Based on different conditions of language pairs, we have experimented with diverse neural machine translation (NMT) techniques: document-enhanced NMT, XLM pre-trained language model enhanced NMT, bidirectional translation as a pre-training, reference language based UNMT, data-dependent gaussian prior objective, and BT-BLEU collaborative filtering self-training. We also used the TF-IDF algorithm to filter the training set to obtain a domain more similar set with the test set for finetuning. In our submissions, the primary systems won the first place on English to Chinese, Polish to English, and German to Upper Sorbian translation directions.
연구 동기 및 목표
- 다양한 번역 시나리오—다량자원, 문서 수준, 저자원—를 고려하여 각 설정에 맞게 NMT 기법을 최적화한다.
- Longformer를 활용한 문서 수준의 맥락 모델링과 BERT의 NSP를 통한 문서 구조 복원을 통해 번역 품질을 향상시킨다.
- 기준 언어 지도, 다국어 미사전학습, 공동 필터링을 활용하여 비지도학습 및 저자원 번역을 향상시킨다.
- 제안된 데이터 의존성 가우시안 사전 확률 목적함수(D2GPo)를 통해 출력 다양성을 유지하고 일반화 능력을 향상시킨다.
- 테스트 세트 분포와 일치하도록 TF-IDF를 활용해 훈련 데이터를 필터링하여 피팅 단계에서 도메인 일치를 최적화한다.
제안 방법
- 문서 수준 맥락 인코딩을 위해 Longformer를 사용한 새로운 문서 증강 NMT 모델을 제안하며, 인코더 및 디코더 레이어에 문서 표현을 주의 기반 융합 방식으로 통합한다.
- XLM 미사전학습 언어 모델을 활용한 NMT 향상 기법으로, 다국어 표현을 위한 마스킹 언어 모델링과 교차 어텐션 메커니즘을 통합한다.
- 이방향 번역을 사전학습 전략으로 적용하여 공유 인코더-디코더를 특정 번역 방향에 맞게 미세조정한다.
- EN-DE 병렬 데이터를 활용해 독일어-위어르술란어 번역에 대해 다국어 지도를 제공하는 기준 언어 기반 비지도 NMT(RUNMT) 기법을 도입한다.
- 고품질의 역번역 문장을 선택하기 위해 BT-BLEU 점수 기반 공동 필터링 자기학습(CFST)을 적용하여 모델의 강건성을 향상시킨다.
- 잠재 공간을 정규화하고 학습 중 출력 다양성을 유지하기 위해 데이터 의존성 가우시안 사전 확률 목적함수(D2GPo)를 적용한다.
실험 결과
연구 질문
- RQ1어떻게 신경 기계 번역에서 문서 수준의 맥락을 효과적으로 모델링할 수 있을까? 번역 품질 향상에 기여하는가?
- RQ2XLM과 같은 미사전학습 다국어 모델이 저자원 및 고자원 언어 쌍에서 지도 기반 NMT 성능을 얼마나 향상시킬 수 있을까?
- RQ3기준 언어 지도가 저자원 환경(예: 독일어-위어르술란어)에서 비지도 번역 성능을 상당히 향상시킬 수 있을까?
- RQ4BT-BLEU 점수 기반 공동 필터링이 비지도 및 저자원 NMT의 자기학습 과정에서 어떻게 향상되는가?
- RQ5TF-IDF를 활용한 데이터 필터링이 NMT 시스템의 도메인 일치 및 미세조정 성능에 어떤 영향을 미치는가?
주요 결과
- 문서 증강 NMT 모델은 기준 모델 대비 영어-중국어 번역에서 단일 모델 성능을 1.5 BLEU 이상 향상시켰다.
- XLM 기반 NMT 모델과 이방향 번역 사전학습 기법 각각이 영어-폴란드어 번역에서 기준 모델 대비 약 2 BLEU 포인트 향상시켰다.
- 최종 시스템은 공식 DE→HSB 테스트 세트에서 60.7 sacreBLEU 점수를 기록하여 비지도 트랙에서 1위를 차지하였다.
- RUNMT에서 RAT, RABT, XBT 학습 타겟을 조합함으로써 DE→HSB에서 기준 모델 대비 BLEU 점수를 11.7 포인트 향상시켰다.
- 저자원 트랙에서 CFST와 D2GPo를 추가함으로써 성능이 1.0–1.5 BLEU 향상되었으며, 이는 상호 보완적이고 효과적인 기여임을 시사한다.
- 앙상블 및 재정렬 기법을 통해 최종 DE→HSB 점수는 공식 기준 60.7점, HSB→DE 기준 58.5점으로 상승하여 모든 방향에서 최상위 순위를 확보하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.