Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Machine Translation Advised by Statistical Machine Translation

Xing Wang, Zhengdong Lu|arXiv (Cornell University)|2016. 10. 17.
Natural Language Processing Techniques참고 문헌 32인용 수 9
한 줄 요약

이 논문은 디코딩 중에 어휘 추천을 제공함으로써 번역 품질을 향상시키기 위해 통계적 기계 번역(SMT) 모델을 통합한 새로운 엔드 투 엔드 신경 기계 번역(NMT) 프레임워크를 제안한다. 보조 분류기와 동적 게이팅 메커니즘을 공동으로 훈련시켜 NMT와 SMT 출력을 융합함으로써, 중국어-영어 NIST 벤치마크에서 NMT보다 2.44 BLEU, Moses SMT보다 3.21 BLEU 향상된 성능을 달성한다.

ABSTRACT

Neural Machine Translation (NMT) is a new approach to machine translation that has made great progress in recent years. However, recent studies show that NMT generally produces fluent but inadequate translations (Tu et al. 2016b; Tu et al. 2016a; He et al. 2016; Tu et al. 2017). This is in contrast to conventional Statistical Machine Translation (SMT), which usually yields adequate but non-fluent translations. It is natural, therefore, to leverage the advantages of both models for better translations, and in this work we propose to incorporate SMT model into NMT framework. More specifically, at each decoding step, SMT offers additional recommendations of generated words based on the decoding information from NMT (e.g., the generated partial translation and attention history). Then we employ an auxiliary classifier to score the SMT recommendations and a gating function to combine the SMT recommendations with NMT generations, both of which are jointly trained within the NMT architecture in an end-to-end manner. Experimental results on Chinese-English translation show that the proposed approach achieves significant and consistent improvements over state-of-the-art NMT and SMT systems on multiple NIST test sets.

연구 동기 및 목표

  • NMT의 한계, 즉 커버리지 문제, 정확도 부족, UNK 단어 문제를 해결하기 위해 SMT의 강점을 활용한다.
  • NMT가 매끄럽지만 때로는 정확하지 않은 번역을 보이는 점을 보완하기 위해, SMT가 원본 단어 커버리지와 희귀어 처리 능력을 갖추고 있음을 활용한다.
  • NMT를 블랙박스로 간주하는 대신, SMT 추천을 NMT 훈련 및 디코딩 과정에 직접 통합한다.
  • 학습 가능한 게이팅 메커니즘을 사용해 NMT 생성 결과와 SMT가 제공하는 어휘 추천을 동적으로 조합함으로써 번역 품질을 향상시킨다.
  • 주의와 커버리지 정보를 기반으로 SMT 추천을 사용해 추론 중 OOV(Out-of-Vocabulary) 단어를 대체함으로써 UNK 문제를 완화한다.

제안 방법

  • NMT에 사용된 동일한 双어 병렬 코퍼스를 기반으로 독립적으로 어구 기반 SMT 모델을 훈련한다.
  • 각 디코딩 단계에서 현재 NMT가 생성한 부분 번역과 주의 히스토리에 기반해 SMT 추천을 생성한다.
  • SMT 추천의 질과 관련성을 평가할 수 있도록 보조 분류기를 사용하여 스코어링한다.
  • 디코딩 컨텍스트에 따라 NMT가 생성한 단어 확률과 SMT 추천을 유연하게 융합하는 미분 가능한 게이팅 함수를 적용한다.
  • 백프로파게이션을 사용해 NMT 모델, SMT 분류기, 게이팅 함수를 엔드 투 엔드 방식으로 공동으로 훈련한다.
  • 추론 과정에서 NMT 주의 정보와 SMT 커버리지 정보를 고려해 SMT 모델이 UNK 토큰의 대체어를 제안한다.

실험 결과

연구 질문

  • RQ1SMT 추천은 유창성을 희생시키지 않고 NMT 번역의 적절성과 정확도를 향상시킬 수 있는가?
  • RQ2학습 가능한 게이팅 메커니즘이 디코딩 중 NMT와 SMT 출력을 동적으로 균형 잡는 데 얼마나 효과적인가?
  • RQ3훈련 단계에서 SMT를 통합하는 것이 히우리스틱 조합 방법보다 더 높은 성능을 내는가?
  • RQ4SMT 기반 추천은 NMT의 UNK 단어 문제를 효과적으로 완화할 수 있는가?
  • RQ5SMT 추천의 품질이 하이브리드 모델의 전체 번역 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 모델은 다섯 개인 중국어-영어 NIST 테스트 세트에서 NMT 베이스라인 대비 2.44 BLEU 포인트 향상된 성능을 기록했다.
  • Moses SMT 시스템 대비 3.21 BLEU 포인트 향상되어 강력한 경쟁 성능을 입증했다.
  • 아블레이션 연구 결과, SMT 추천을 제거하면 성능이 1.55 BLEU 포인트 저하됨으로써 그 필요성을 입증했다.
  • 동적 게이팅 메커니즘을 제거할 경우 2.09 BLEU 포인트 성능 저하가 발생하여, 이 메커니즘이 NMT와 SMT 출력을 균형 있게 조절하는 데 핵심적인 역할을 함을 확인했다.
  • 저품질 또는 무작위 SMT 추천을 사용할 경우 1.54 BLEU 포인트 성능 저하가 발생하여, 높은 품질의 SMT 추천이 중요함을 입증했다.
  • 게이팅 함수와 분류기의 공동 엔드 투 엔드 훈련을 통해, 훈련 및 추론 과정에서 SMT 가이던스의 효과적인 통합을 학습할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.