Skip to main content
QUICK REVIEW

[논문 리뷰] Zero-Shot Translation Quality Estimation with Explicit Cross-Lingual Patterns

Lei Zhou, Liang Ding|arXiv (Cornell University)|2020. 10. 10.
Topic Modeling참고 문헌 31인용 수 11
한 줄 요약

이 논문은 BERTScore를 개선하기 위해 명시적인 다국어 패턴—단어 정렬 마스킹 및 생성 점수(혼란도)—를 통합함으로써 토큰 수준의 불일치 오류를 줄이는 제로샷 번역 품질 평가(QE) 방법을 제안한다. 이 방법은 지도 학습 기반 QE 모델과 유사한 성능을 달성하며, WMT 2020 QE 공동 과제 평가에서 여섯 번의 번역 방향 중 두 곳에서 이를 뛰어넘는다.

ABSTRACT

This paper describes our submission of the WMT 2020 Shared Task on Sentence Level Direct Assessment, Quality Estimation (QE). In this study, we empirically reveal the \ extit{mismatching issue} when directly adopting BERTScore to QE. Specifically, there exist lots of mismatching errors between the source sentence and translated candidate sentence with token pairwise similarity. In response to this issue, we propose to expose explicit cross-lingual patterns, \ extit{e.g.} word alignments and generation score, to our proposed zero-shot models. Experiments show that our proposed QE model with explicit cross-lingual patterns could alleviate the mismatching issue, thereby improving the performance. Encouragingly, our zero-shot QE method could achieve comparable performance with supervised QE method, and even outperforms the supervised counterpart on 2 out of 6 directions. We expect our work could shed light on the zero-shot QE model improvement.

연구 동기 및 목표

  • BERTScore 기반 제로샷 QE에서 원인 불일치 문제를 해결하기 위해, 다국어 지도가 부족한 상황에서 소스 토큰과 타겟 토큰이 잘못 매칭되는 현상을 방지하기 위함.
  • 인간이 수작업으로 작성한 기준 번역문이나 미세조정(fine-tuning) 없이도 제로샷 QE 성능을 향상시키기 위함.
  • 단어 정렬 및 생성 점수와 같은 명시적인 다국어 신호가 기준 번역 없이도 QE의 정확성과 내성 강도를 향상시킬 수 있는지 조사하기 위함.
  • 간단한, 미세조정되지 않은 BERTScore 기반 모델이 다국어 패턴을 통합함으로써 경쟁 가능한 성능을 달성할 수 있음을 입증하기 위함.

제안 방법

  • 다국어 BERT와 XLM을 사용하여 소스 문장과 번역 문장을 공통된 의미 공간에 임bedding하여 다국어 비교를 수행한다.
  • 맥락적 임베딩의 내적곱 유사도를 기반으로, 소스 토큰을 가장 유사한 타겟 토큰과 탐색적 매칭(greedy matching)을 수행한다.
  • GIZA++로 유도된 단어 정렬을 활용한 다국어 정렬 마스킹을 도입하여 토큰 매칭을 안내하고 불일치 오류를 감소시킨다.
  • 사전에 훈련된 다국어 모델을 사용해 강제 디코딩된 타겟 토큰의 생성 점수(혼란도)를 통합하여 유사도 점수를 가중치 처리한다.
  • 정렬 마스킹과 혼란도 점수를 가중치 융합을 통해 BERTScore에 통합하여 매칭 정확도를 향상시킨다.
  • WMT 2020 QE 공동 과제에서 평가하기 위해 직접 평가(DA) 점수와의 피어슨 상관관계 및 켄달 상관관계를 평가 지표로 사용한다.

실험 결과

연구 질문

  • RQ1BERTScore를 사용할 때 명시적인 다국어 패턴이 토큰 수준의 불일치 문제를 완화시킬 수 있는가?
  • RQ2단어 정렬과 생성 점수를 통합하면 예측된 QE 점수와 인간이 평가한 직접 평가(DA) 점수 간 상관관계가 향상되는가?
  • RQ3미세조정 없이도 제로샷 QE 모델이 일부 번역 방향에서 지도 학습 기반 모델을 뛰어넘을 수 있는가?
  • RQ4이러한 방법은 특히 자원이 적은 언어 쌍에서도 얼마나 효과적인가?

주요 결과

  • 정렬 마스킹과 혼란도 점수를 모두 통합한 본 논문의 방법은 en-de에서 피어슨 상관관계 0.099, en-zh에서 0.189, ru-en에서 0.332를 기록하며, 이 방향들에서 기준 BERTScore보다 뛰어난 성능을 보였다.
  • ru-en 방향에서 본 모델은 피어슨 상관관계 0.332를 기록했으며, 동일한 테스트 세트에서 지도 학습 기반 모델(0.146)을 초월했다.
  • 모델은 여섯 번의 번역 방향 중 두 곳(ru-en 및 si-en)에서 지도 학습 기반 모델을 뛰어넘었으며, 이는 강력한 제로샷 일반화 능력을 보여준다.
  • 혼란도 점수만 통합해도 대부분의 방향에서 성능 향상이 있었으며, en-de에서 피어슨 상관관계 0.105, ro-en에서 0.439로 가장 높은 성능 기록을 하였다.
  • 제거 실험(ablation study) 결과, 정렬 마스킹과 혼란도 점수 모두 성능 향상에 독립적으로 기여하며, 병합된 방법이 가장 우수한 성능을 기록하였다.
  • qualitative 예시를 통해 본 방법은 불일치 오류를 크게 감소시켰으며, 예를 들어 러시아어 토큰 'Назва'를 'The'가 아니라 'named'로 정확히 매칭하는 데 성공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.