Skip to main content
QUICK REVIEW

[논문 리뷰] Prevent the Language Model from being Overconfident in Neural Machine Translation

Mengqi Miao, Fandong Meng|arXiv (Cornell University)|2021. 05. 24.
Natural Language Processing Techniques참고 문헌 43인용 수 4
한 줄 요약

이 논문은 신경 기계 번역(NMT)에서 환각 현상을 줄이기 위해 NMT 내부의 내재된 언어모델(LM)의 과신임을 다루는 새로운 접근법을 제안한다. LM 과신임을 측정하는 지표로 NMT와 LM 사이의 마진을 도입하고, 이 마진을 최대화하기 위한 두 가지 목적함수(MTO 및 MSO)를 제안함으로써 WMT14 En-De, WMT19 Zh-En, WMT14 En-Fr 작업에서 각각 +1.36, +1.50, +0.63의 BLEU 향상을 이룩하였으며, 인간 평가를 통한 적정성 향상도 확인되었다.

ABSTRACT

The Neural Machine Translation (NMT) model is essentially a joint language model conditioned on both the source sentence and partial translation. Therefore, the NMT model naturally involves the mechanism of the Language Model (LM) that predicts the next token only based on partial translation. Despite its success, NMT still suffers from the hallucination problem, generating fluent but inadequate translations. The main reason is that NMT pays excessive attention to the partial translation while neglecting the source sentence to some extent, namely overconfidence of the LM. Accordingly, we define the Margin between the NMT and the LM, calculated by subtracting the predicted probability of the LM from that of the NMT model for each token. The Margin is negatively correlated to the overconfidence degree of the LM. Based on the property, we propose a Margin-based Token-level Objective (MTO) and a Margin-based Sentencelevel Objective (MSO) to maximize the Margin for preventing the LM from being overconfident. Experiments on WMT14 English-to-German, WMT19 Chinese-to-English, and WMT14 English-to-French translation tasks demonstrate the effectiveness of our approach, with 1.36, 1.50, and 0.63 BLEU improvements, respectively, compared to the Transformer baseline. The human evaluation further verifies that our approaches improve translation adequacy as well as fluency.

연구 동기 및 목표

  • NMT에서 번역의 부적절성의 근본 원인을 규명하는 것, 특히 유창하지만 잘못된 출력을 생성하는 내재된 언어모델(LM)의 과신임을 중심으로 한다.
  • NMT 디코딩 중에 LM 과신임을 측정 가능한 지표로 정의하여, 정확한 간섭을 가능하게 하는 것.
  • NMT와 LM의 확률 간 마진을 직접 최대화하는 데 목적이 있는 최적화 목적함수를 제안하여 부분 번역에 대한 과도한 의존도를 줄이는 것.
  • 추가 데이터나 모델 아키텍처 변경 없이, 학습 시점 최적화에 집중하여 번역의 적정성을 향상시키는 것.

제안 방법

  • NMT와 LM 사이의 마진은 각 타겟 토큰에 대해 NMT 모델의 예측 확률과 LM의 예측 확률의 차이로 정의된다.
  • 마진 기반 토큰 수준 목적함수(MTO)는 학습 중에 토큰 수준에서 이 마진을 최대화하도록 설정된다.
  • 마진 기반 문장 수준 목적함수(MSO)에 동적 가중치 함수를 도입하여, 많은 음수 마진 토큰을 포함한 문장을 식별하고, 이는 성능 저하를 유발하는 '더러운 데이터'로 간주하여 가중치를 낮춘다.
  • MSO 목적함수는 피지컬 튜닝 중에 적용되어, 모델 자체가 마진 품질을 평가함에 따라 문제적 학습 예제를 반복적으로 걸러내는 데 사용된다.
  • 모델 아키텍처 변경 없이 Transformer 아키텍처에 적용되며, 손실 함수 조정만을 사용한다.
  • 표준 교차 엔트로피 손실을 기반으로 엔드 투 엔드로 학습되며, 마진 목적함수는 보조 학습 신호로 추가된다.

실험 결과

연구 질문

  • RQ1내재된 언어모델의 과신임이 NMT에서 번역의 부적절성에 얼마나 기여하는가?
  • RQ2디코딩 중에 NMT와 LM의 확률 간 마진이 LM 과신임을 신뢰성 있게 나타내는 지표가 될 수 있는가?
  • RQ3보조 목적함수를 통해 이 마진을 최대화하면, 유창성 손실 없이 번역의 적정성을 향상시킬 수 있는가?
  • RQ4마진 품질 기반의 동적 데이터 선택 메커니즘이 학습 효율성과 모델 일반화를 향상시킬 수 있는가?

주요 결과

  • 제안된 마진 기반 토큰 수준 목적함수(MTO)는 Transformer 기준 모델 대비 WMT14 영어-독어 번역 작업에서 +1.36 BLEU 향상을 달성하였다.
  • 마진 기반 문장 수준 목적함수(MSO)는 WMT19 중국어-영어 번역 작업에서 +1.50 BLEU 향상을 달성하여 MTO를 초월하였다.
  • WMT14 영어-프랑스어 번역 작업에서는 +0.63 BLEU 향상을 기록하여 다양한 언어 쌍에 걸쳐 일관된 성과 향상을 보였다.
  • 인간 평가를 통해 제안된 방법을 사용해 생성된 번역은 더 적정성이 높으며, 유창성은 유지하거나 향상된 것으로 확인되었다.
  • MSO의 동적 가중치 함수는 고음수 마진을 가진 '더러운 데이터'를 성공적으로 식별하고 가중치를 낮춰 학습 안정성과 성능 향상을 개선했다.
  • 모델 아키텍처 변경이나 외부 데이터 없이도 손실 함수 최적화에만 의존하여 번역 품질을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.