Skip to main content
QUICK REVIEW

[논문 리뷰] The Effect of Translationese in Machine Translation Test Sets

Mike Zhang, Antonio Toral|arXiv (Cornell University)|2019. 06. 19.
Natural Language Processing Techniques참고 문헌 17인용 수 6
한 줄 요약

이 연구는 WMT 2016–2018 뉴스 共同 작업 데이터를 활용하여 17개의 어순 쌍에 걸쳐 기계 번역(MT) 테스트 세트에서 번역어(translationese)의 영향을 조사한다. 번역어가 원본 테스트 세트에 포함될 경우 인간 평가 점수가 과대 평가되고, 시스템 순위가 왜곡되며, 특히 저품질 번역 방향에서 더 심각하게 영향을 미쳐 MT 연구의 벤치마크 평가의 타당성을 도전한다.

ABSTRACT

The effect of translationese has been studied in the field of machine translation (MT), mostly with respect to training data. We study in depth the effect of translationese on test data, using the test sets from the last three editions of WMT's news shared task, containing 17 translation directions. We show evidence that (i) the use of translationese in test sets results in inflated human evaluation scores for MT systems; (ii) in some cases system rankings do change and (iii) the impact translationese has on a translation direction is inversely correlated to the translation quality attainable by state-of-the-art MT systems for that direction.

연구 동기 및 목표

  • MT 테스트 세트의 원본 텍스트에 번역어가 포함될 경우 인간 평가 점수가 MT 시스템에 대해 인위적으로 과대 평가되는지 조사하는 것.
  • 테스트 세트에 번역어가 존재할 경우 WMT 평가에서 시스템 순위가 어떻게 변화하는지 규명하는 것.
  • 번역어의 영향이 언어 쌍 간에, 특히 언어적 거리나 번역 품질과 관련하여 다를 수 있는지 검토하는 것.
  • 번역어가 테스트 세트에 포함된 현재의 MT 벤치마크 평가 방식의 타당성을 도전하는 것.
  • 테스트 세트 구성이 MT 평가 결과에 상당한 영향을 미친다는 실증적 증거를 제공하는 것.

제안 방법

  • 연구는 WMT 2016–2018 뉴스 共同 작업 테스트 세트를 분석하며, 이는 원본 및 번역어 원본 텍스트를 모두 포함한다.
  • 언어학적 및 메타데이터 신호를 바탕으로 테스트 세트를 원본(O→T) 및 번역어(T→O) 원본 세그먼트로 분리한다.
  • O→T 및 T→O 세그먼트 간의 인간 평가 점수(DA 점수)를 비교하여 성능 과대 평가 정도를 측정한다.
  • 번역어 세그먼트를 제거한 후 시스템 순위를 재평가하여 순위 안정성을 평가한다.
  • 통계적 군집 분석을 위해 윌코크슨 순위합 검정을 사용하여 시스템 성능 순서의 유의미한 변화를 식별한다.
  • 상관관계 분석을 통해 번역어 영향과 달성 가능한 번역 품질(BLEU 또는 DA 점수 등) 간의 관계를 분석한다.

실험 결과

연구 질문

  • RQ1MT 테스트 세트의 원본 측에서 번역어를 사용할 경우 MT 시스템에 불리하게 작용하는가, 아니면 중국어→영어와 같은 특정 케이스에 국한되는가?
  • RQ2테스트 세트에서 번역어 세그먼트를 제거할 경우 WMT 평가에서 시스템 순위가 변화하는가?
  • RQ3번역어의 영향이 일부 언어 쌍, 특히 달성 가능한 번역 품질이 낮은 언어 쌍에서 더 두드러지는가?
  • RQ4테스트 세트의 번역어가 인간 평가 점수와 자동 메트릭 상관관계를 얼마나 심각하게 왜곡하는가?

주요 결과

  • 테스트 세트 원본 텍스트에 번역어가 포함될 경우 인간 평가 점수가 과대 평가되며, 시스템이 번역어 입력에서 유의미하게 높은 DA 점수를 기록한다.
  • 17개 언어 쌍 중 14개에서 번역어 세그먼트를 제거한 결과, 최소 한 개 이상의 시스템이 순위가 1위 이상 변화하였다.
  • 번역어가 시스템 성능에 미치는 영향은 달성 가능한 번역 품질과 반비례한다: 저품질 번역 방향(예: 영어→터키어)일수록 더 큰 영향을 받는다.
  • 영어→터키어 방향에서 상위 시스템은 원본 언어 입력에서 평가했을 때 순위가 1위에서 4위로 하락하여 상당한 순위 이동이 발생하였다.
  • 번역어의 영향은 자원이 적거나 품질이 낮은 번역 방향에서 가장 두드러지며, 이 경우 번역어의 단순화가 성능 격차를 더욱 확대시킨다.
  • 연구는 테스트 세트 구성, 특히 원본 언어의 기원이 MT 평가 결과에 상당한 편향을 미친다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.