Skip to main content
QUICK REVIEW

[논문 리뷰] Machine Translation Evaluation using Bi-directional Entailment

Rakesh Khobragade, Heaven Patel|arXiv (Cornell University)|2019. 11. 02.
Natural Language Processing Techniques참고 문헌 17인용 수 5
한 줄 요약

이 논문은 기계 번역과 기준 번역 간의 의미 유사성을 평가하기 위해 미세튜닝된 BERT를 사용한 이중 방향 텍스트 함의 기반의 새로운 기계 번역 평가 지표를 제안한다. 양방향에서의 함의를 평가함으로써, 이 방법은 인간 평가와의 상관관계가 높아져 WMT'14에서 평균 0.957을 기록하며, BLEU 및 LAYERED와 같은 전통적인 지표보다도 의미 적합성을 더 잘 포착함을 입증한다.

ABSTRACT

In this paper, we propose a new metric for Machine Translation (MT) evaluation, based on bi-directional entailment. We show that machine generated translation can be evaluated by determining paraphrasing with a reference translation provided by a human translator. We hypothesize, and show through experiments, that paraphrasing can be detected by evaluating entailment relationship in the forward and backward direction. Unlike conventional metrics, like BLEU or METEOR, our approach uses deep learning to determine the semantic similarity between candidate and reference translation for generating scores rather than relying upon simple n-gram overlap. We use BERT's pre-trained implementation of transformer networks, fine-tuned on MNLI corpus, for natural language inferencing. We apply our evaluation metric on WMT'14 and WMT'17 dataset to evaluate systems participating in the translation task and find that our metric has a better correlation with the human annotated score compared to the other traditional metrics at system level.

연구 동기 및 목표

  • BLEU와 같은 n-그램 겹침 기반 지표보다 의미 유사성을 더 잘 포착하는 기계 번역 평가 지표를 개발하는 것.
  • 이중 방향 함의가 번역 품질 평가에서 복제 및 의미 동치성의 신뢰할 수 있는 대체 척도가 될 수 있는지 조사하는 것.
  • 어휘 겹침이 아닌 의미 유사성에 기반한 딥러닝을 활용하여 인간 평가와의 시스템 수준 상관관계를 향상시키는 것.
  • MNLI에 대해 미세튜닝된 BERT가 번역 평가에서 다국어 함의에 어떻게 기여하는지 평가하는 것.
  • 일방향 함의의 한계를 탐색하고 비대칭적 의미 관계를 보상하는 제품 기반 점수 기반 메커니즘을 제안하는 것.

제안 방법

  • 기계 번역 평가를 위한 문장 쌍 함의 분류기로 사용하기 위해 MNLI 코퍼스에 기반해 BERT의 기본 언캐스트 모델을 미세튜닝하는 것.
  • 기계 번역 후보와 기준 번역 간의 정방향 및 역방향 함의 점수를 함의 모델을 사용해 계산하는 것.
  • 정방향 및 역방향 함의 확률의 곱을 최종 점수로 계산하여 이중 방향 의미 동치성을 강제하는 것.
  • 모델을 WMT’14 및 WMT’17 데이터셋에 적용하여 인간이 평가한 점수와의 시스템 수준 성능을 평가하는 것.
  • BERT의 토크나이저를 사용해 엔드 투 엔드 토크나이징을 수행하고, 시퀀스 길이 128, 배치 크기 8, 학습률 2e-5로 3 에포크 동안 학습하는 것.
  • 결과를 검증하기 위해 99% 신뢰수준에서 일측 검정을 사용한 대응 t-검정을 수행하는 것.

실험 결과

연구 질문

  • RQ1이중 방향 함의 탐지가 기계 번역 평가에 있어 의미 유사성의 신뢰할 수 있는 측도로 기능할 수 있는가?
  • RQ2BERT 기반 함의 모델은 인간 평가와의 상관관계에서 기존의 n-그램 지표인 BLEU 및 METEOR보다 어떻게 비교되는가?
  • RQ3정방향 및 역방향 함의 점수의 곱은 단일 방향 점수보다 인간이 인식하는 번역 품질을 더 잘 반영하는가?
  • RQ4MNLI에 대해 BERT를 미세튜닝하는 것이 다른 의미 유사성 방법에 비해 번역 평가 작업에서 성능을 얼마나 향상시키는가?
  • RQ5제안된 지표는 인간 점수와의 시스템 수준 상관관계에서 최신 기술 지표인 LAYERED 및 DiscoTK-Party를 능가할 수 있는가?

주요 결과

  • 제안된 Bi-Di-Ent 지표는 WMT’14 데이터셋에서 인간 평가와의 평균 시스템 수준 상관관계가 0.957을 기록하며, BLEU(0.871) 및 LAYERED(0.915)를 모두 초월한다.
  • WMT’17에서 Bi-Di-Ent는 평균 상관관계 0.956을 기록하여 두 번째로 높은 성능을 보였으며, 상위 성능 지표인 0.960에 근소하게 못 미쳤고, lv-en 및 tr-en 이외의 모든 언어 쌍에서 BLEU를 모두 초월한다.
  • WMT’17에서 Bi-Di-Ent는 de-en 및 ru-en 언어 쌍에서 평가된 모든 지표 중에서 가장 높은 상관관계를 기록한다.
  • 통계적 유의성 검정을 통해 결과는 일측 검정을 사용한 99% 신뢰수준에서 유의미하다고 확인된다.
  • 수동 분석 결과, 인간이 더 나은 번역으로 평가한 번역에 대해 지표가 더 높은 점수를 부여하고, 의미 일반화로 인해 단방향 함의만 존재하는 경우를 정확히 보상하는 것으로 나타났다.
  • 이 방법은 기계 번역에서 복제 및 의미 적합성의 강력한 지표로 이중 방향 함의가 작용한다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.