Skip to main content
QUICK REVIEW

[논문 리뷰] Minimum Bayes Risk Decoding with Neural Metrics of Translation Quality.

Markus Freitag, David Grangier|arXiv (Cornell University)|2021. 11. 17.
Natural Language Processing Techniques참고 문헌 39인용 수 6
한 줄 요약

이 논문은 BLEURT와 같은 신경 기반 메트릭을 사용한 최소 베이즈 손실(MBR) 디코딩을 제안하여 표면적 메트릭보다 인간 평가 기반 번역 품질을 최적화함으로써 기계 번역 품질을 향상시킨다. 이 방법은 낮은 가능도를 가진 번역을 생성하지만 인간 평가와의 상관관계는 크게 높아지며, 자동 평가 및 인간 평가 모두에서 표준 빔 서치를 능가한다.

ABSTRACT

This work applies Minimum Bayes Risk (MBR) decoding to optimize diverse automated metrics of translation quality. Automatic metrics in machine translation have made tremendous progress recently. In particular, neural metrics, fine-tuned on human ratings (e.g. BLEURT, or COMET) are outperforming surface metrics in terms of correlations to human judgements. Our experiments show that the combination of a neural translation model with a neural reference-based metric, BLEURT, results in significant improvement in automatic and human evaluations. This improvement is obtained with translations different from classical beam-search output: these translations have much lower likelihood and are less favored by surface metrics like BLEU.

연구 동기 및 목표

  • BLEU와 같은 표면적 메트릭이 아닌 신경 기반 메트릭을 최적화함으로써 기계 번역 품질을 향상시키는 것.
  • MBR 디코딩과 신경 기반 기준 메트릭이 인간 평가와의 일치도를 높이는지 조사하는 것.
  • 신경 기반 기계 번역 출력에서 가능도와 품질 간의 트레이드오프를 탐색하는 것.
  • BLEURT와 같은 신경 기반 메트릭이 표준 빔 서치를 넘어서는 디코딩 전략에 미치는 영향을 평가하는 것.

제안 방법

  • BLEURT와 같은 신경 기반 메트릭을 기반으로 한 예측 손실의 기대값을 최소화하는 번역을 선택하기 위해 최소 베이즈 손실(MBR) 디코딩을 적용한다.
  • 기존의 n-그램 또는 표면 기반 메트릭 대신, 미세조정된 신경 기반 메트릭(예: BLEURT)을 디코딩 중 손실 함수로 사용한다.
  • 다양한 번역 후보를 생성하고, 신경 기반 메트릭에 따라 기대 위험값이 가장 낮은 것을 선택한다.
  • 인간 평가 기반 품질 메트릭에서 높은 점수를 얻는 출력을 선호하는 MBR 목적함수에 기반한 신경 번역 모델을 조건화한다.
  • 기준 기반 신경 기반 메트릭을 디코딩 과정에 통합하여 더 높은 품질의 출력으로의 생성을 이끌어낸다.

실험 결과

연구 질문

  • RQ1BLEURT와 같은 신경 기반 메트릭을 사용한 MBR 디코딩이 표준 빔 서치를 뛰어넘어 번역 품질을 향상시킬 수 있는가?
  • RQ2MBR로 생성된 번역은 인간 평가 및 자동 메트릭 측면에서 빔 서치 출력과 어떻게 비교되는가?
  • RQ3낮은 가능도를 가진 MBR 출력이 인간 평가와의 상관관계에서 얼마나 높은 수준에 도달하는가?
  • RQ4디코딩 과정에서 기준 기반 신경 기반 메트릭을 사용하면 더 자연스럽거나 유창한 번역이 생성되는가?

주요 결과

  • BLEURT를 사용한 MBR 디코딩은 빔 서치 출력보다 인간 평가와의 일치도가 뚜렷이 높은 번역을 생성한다.
  • MBR로 생성된 번역은 자동 메트릭(예: BLEURT, COMET)과 인간 평가 양측에서 높은 점수를 기록한다.
  • 낮은 가능도를 가짐에도 불구하고 MBR 출력은 인간 평가에서 빔 서치를 능가하며, 이는 유창성과 품질 간의 트레이드오프가 유익할 수 있음을 시사한다.
  • 이 방법은 BLEU와 같은 표면 메트릭에서는 덜 선호되는 번역을 생성함으로써, n-그램 기반 메트릭의 한계를 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.