Skip to main content
QUICK REVIEW

[논문 리뷰] Regularizing Neural Machine Translation by Target-bidirectional Agreement

Zhirui Zhang, Shuangzhi Wu|arXiv (Cornell University)|2018. 08. 13.
Natural Language Processing Techniques참고 문헌 27인용 수 8
한 줄 요약

이 논문은 신경 기계 번역(NMT)을 위한 새로운 정규화 방법을 제안하며, 왼쪽에서 오른쪽(L2R) 및 오른쪽에서 왼쪽(R2L) 디코더 간의 일치를 강제하여 번역 품질을 향상시킵니다. 학습 목표에 두 개의 쿨백-라이블러 발산(KL) 항을 추가하고 양 모델을 함께 최적화함으로써 노출 편향을 줄이고 중국어-영어 및 영어-독일어 번역 작업에서 성능을 크게 향상시킵니다.

ABSTRACT

Although Neural Machine Translation (NMT) has achieved remarkable progress in the past several years, most NMT systems still suffer from a fundamental shortcoming as in other sequence generation tasks: errors made early in generation process are fed as inputs to the model and can be quickly amplified, harming subsequent sequence generation. To address this issue, we propose a novel model regularization method for NMT training, which aims to improve the agreement between translations generated by left-to-right (L2R) and right-to-left (R2L) NMT decoders. This goal is achieved by introducing two Kullback-Leibler divergence regularization terms into the NMT training objective to reduce the mismatch between output probabilities of L2R and R2L models. In addition, we also employ a joint training strategy to allow L2R and R2L models to improve each other in an interactive update process. Experimental results show that our proposed method significantly outperforms state-of-the-art baselines on Chinese-English and English-German translation tasks.

연구 동기 및 목표

  • 자기회귀적 생성에서 초기 오류가 누적되어 번역 품질을 떨어뜨리는 NMT의 노출 편향 문제를 해결합니다.
  • L2R 및 R2L 디코더의 상호보완적 강점을 활용하여 시퀀스 생성의 강건성을 향상시킵니다.
  • 학습과 추론 간의 일관성 불일치를 줄이기 위해 학습 중 L2R 및 R2L 모델의 확률 분포를 정렬합니다.
  • 모델 아키텍처나 추론 속도를 변경하지 않는 단순하고 효율적인 정규화 기법을 개발합니다.
  • 공동 정규화 목표를 공유하는 상호작용적 공동 학습을 통해 L2R 및 R2L 모델 간의 상호 개선을 가능하게 합니다.

제안 방법

  • 표준 NMT 학습 목표에 L2R 및 R2L 모델의 출력 확률 분포 간 격리 정도를 최소화하기 위한 두 개의 쿨백-라이블러(KL) 발산 정규화 항을 도입합니다.
  • L2R 및 R2L 모델 출력 간의 KL 발산을 사용하여 학습 중에 노출 편향을 측정하고 감소시킵니다.
  • 학습 시간을 크게 증가시키지 않으면서도 정규화 항을 효율적으로 계산하기 위한 근사 알고리즘을 설계합니다.
  • L2R 및 R2R 모델이 서로를 보조자로 하며 상호작용적으로 업데이트되는 공동 학습 전략을 구현합니다.
  • 디코더 구조나 추론 메커니즘을 변경하지 않음으로써 원래의 모델 아키텍처와 추론 속도를 유지합니다.
  • 최대우도추정과 상호모델 일치 정규화를 결합한 공통 목표를 사용해 양 모델을 종단 간(end-to-end)으로 학습합니다.

실험 결과

연구 질문

  • RQ1L2R 및 R2L NMT 디코더 간의 학습 중 일치를 강제하면 노출 편향이 줄어들고 번역 품질이 향상될 수 있는가?
  • RQ2제안된 KL 발산 정규화는 표준 MLE 학습 대비 시퀀스 생성의 강건성을 어떻게 향상시키는가?
  • RQ3양방향 일치를 갖는 공동 학습을 통해 L2R 및 R2L 모델은 얼마나 서로 상호 개선할 수 있는가?
  • RQ4이 방법은 다양한 번역 작업에서 강력한 기준 모델보다 더 나은 성능을 내면서도 추론 속도를 유지하는가?
  • RQ5이 정규화 기법은 NMT를 넘어 요약이나 대화 생성과 같은 다른 시퀀스-투-시퀀스 작업으로 일반화될 수 있는가?

주요 결과

  • 제안된 방법은 중국어-영어 및 영어-독일어 번역 작업에서 최신 기준 모델들을 뛰어넘으며 BLEU 점수에서 일관된 향상을 보입니다.
  • 양방향 일치를 갖는 공동 학습은 잘못된 접두사 및 접미사 생성을 줄이며, 두 모델의 강점을 조합한 질적 예시에서 이를 입증합니다.
  • 모델 아키텍처를 변경하거나 추론 시간을 늘리지 않으면서도 번역 품질을 향상시켜 표준 NMT 시스템의 효율성을 유지합니다.
  • KL 발산 정규화는 L2R 및 R2L 출력 간의 일관성을 장려함으로써 노출 편향을 효과적으로 측정하고 완화합니다.
  • 사례 연구 결과, 장거리 문장에서 오류 전파 위험이 있는 경우에 특히 뛰어난 번역 품질을 내며 단독 L2R 또는 R2L 모델보다 우수한 성능을 보입니다.
  • 이 방법은 트랜스포머 기반 모델에도 효과적이므로 다양한 NMT 아키텍처에 널리 적용 가능함을 시사합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.