[논문 리뷰] RoBLEURT Submission for the WMT2021 Metrics Task
이 논문은 원본 텍스트 포함 및 참조 문서 전용 모델링, 합성 데이터에서의 연속 미세조정, 재평가를 통한 데이터 노이즈 제거를 결합함으로써 자동 번역 평가를 향상시키는 강력하게 훈련된 메트릭 모델인 RoBLEURT을 제시한다. 이 모델은 WMT2020 벤치마크에서 10개 언어 쌍 중 8개에서 인간 평가와의 상관관계에서 최고 성능을 기록한다.
In this paper, we present our submission to Shared Metrics Task: RoBLEURT (Robustly Optimizing the training of BLEURT). After investigating the recent advances of trainable metrics, we conclude several aspects of vital importance to obtain a well-performed metric model by: 1) jointly leveraging the advantages of source-included model and reference-only model, 2) continuously pre-training the model with massive synthetic data pairs, and 3) fine-tuning the model with data denoising strategy. Experimental results show that our model reaching state-of-the-art correlations with the WMT2020 human annotations upon 8 out of 10 to-English language pairs.
연구 동기 및 목표
- 저자원 및 고자원 언어 쌍 모두에 일반화 가능한 강력하고 높은 성능을 보이는 번역 평가용 메트릭 모델을 개발하는 것.
- N-그램 기반 메트릭이 의미 일관성과 어휘 재구성(paraphrasing)을 포괄하지 못하는 한계를 해결하는 것.
- 다국어 및 단일 언어 모델링 전략을 융합하여 인간 평가와의 상관관계를 향상시키는 것.
- 합성 데이터에서의 연속 사전 훈련과 노이즈 제거된 실제 데이터로의 미세조정을 통해 모델의 강건성 향상시키는 것.
- 원본 텍스트 포함 및 원본 텍스트 없는 버전의 모델 조합이 전체 성능 향상에 기여하는지 조사하는 것.
제안 방법
- 모델은 RoBERTa-large를 기본 인코더로 사용하며, 별도의 버전으로 RoBLEURT- Src(원본 입력 포함)와 RoBLEURT- NoSrc(가설 및 참조만 포함)를 제공한다.
- RoBLEURT- Src의 입력 포맷은 [src] [hyp] [ref] 형식으로 특수 토큰을 사용해 입력을 구조화하며, RoBLEURT- NoSrc는 다중 입력을 처리하기 위해 수정된 형식을 사용한다.
- 모델은 [CLS] 토큰 표현에 선형 회귀 헤드를 적용하여 의미 일관성을 반영하는 스칼라 점수를 예측한다.
- 일반화 능력을 향상시키기 위해 강력한 MT 시스템에서 생성한 막대한 양의 합성 데이터 쌍을 사용해 연속 사전 훈련을 수행한다.
- 미세조정 단계에서는 2018~2019년도 WMT 데이터에서 노이즈가 포함된 데이터를 강력한 메트릭 기반 모델을 사용해 재평가한 후, 이를 모델 훈련에 재사용한다.
- 모델 출력은 가중 평균을 통해 원본 텍스트 포함 및 원본 텍스트 없는 구성의 장점을 모두 활용한다.
실험 결과
연구 질문
- RQ1원본 텍스트 포함 및 참조 문서 전용 모델링을 융합하면 다양한 언어 쌍에서 성능 향상이 이루어지는가?
- RQ2합성 데이터에서의 연속 사전 훈련이 훈련 가능한 MT 메트릭의 강건성과 일반화 능력을 향상시키는가?
- RQ3강력한 기반 모델을 사용해 재평가하는 방식의 데이터 노이즈 제거가 미세조정 성능 향상에 얼마나 효과적인가?
- RQ4저자원 및 고자원 환경 모두에서 모델 조합이 개별 모델보다 성능이 뛰어나게 되는가?
- RQ5미세조정된 체크포인트(예: XNLI)를 갖춘 RoBERTa 기반 모델이 표준 BERT 기반 메트릭 모델을 능가할 수 있는가?
주요 결과
- RoBERTa-large-xnli 체크포인트를 사용한 RoBLEURT- Src는 각각 cs-en, de-en, ja-en, ru-en, zh-en에서 14.1, 47.9, 28.7, 11.7, 14.9의 킬다인 타우 상관관계를 기록한다.
- RoBERTa-base 대비 RoBERTa-large를 사용할 경우 성능 향상이 발생하며, 추가로 미세조정된 RoBERTa-large-xnli 체크포인트를 사용할 경우 성능 향상이 더욱 두드러진다.
- 훈련 중 노이즈가 포함된 WMT 데이터를 제거하면 성능 저하가 발생하지만, 재평가 후 재도입하면 성능 향상이著명하게 이루어진다.
- RoBLEURT- Src와 RoBLEURT- NoSrc의 모델 조합은 개별 모델보다 성능 향상을 이끌어내며, 특히 저자원 환경에서 두드러진다.
- 합성 사전 훈련과 노이즈 제거를 포함한 전체 파이프라인은 WMT2020 벤치마크에서 10개 언어 쌍 중 8개에서 최고 성능 상관관계를 기록한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.