Skip to main content
QUICK REVIEW

[논문 리뷰] Attention Focusing for Neural Machine Translation by Bridging Source and Target Embeddings

Shaohui Kuang, Junhui Li|arXiv (Cornell University)|2017. 11. 15.
Natural Language Processing Techniques참고 문헌 19인용 수 3
한 줄 요약

이 논문은 신경 기계 번역(NMT)에서 원천어 및 목적어 단어 임베딩 간의 거리를 줄여 어휘 대응과 번역 품질을 향상시키기 위해 세 가지 브리지 모델—원천 측 브리지, 목적어 측 브리지, 직접 브리지—을 제안한다. seq2seq 아키텍처 내에서 원천 및 목적어 임베딩을 더 밀접하게 통합함으로써, 이 모델들은 대응 정확도를 크게 향상시키고 과도 번역 및 부족 번역을 줄이며, 외부 자원 없이도 표준 NMT를 능가한다.

ABSTRACT

In neural machine translation, a source sequence of words is encoded into a vector from which a target sequence is generated in the decoding phase. Differently from statistical machine translation, the associations between source words and their possible target counterparts are not explicitly stored. Source and target words are at the two ends of a long information processing procedure, mediated by hidden states at both the source encoding and the target decoding phases. This makes it possible that a source word is incorrectly translated into a target word that is not any of its admissible equivalent counterparts in the target language. In this paper, we seek to somewhat shorten the distance between source and target words in that procedure, and thus strengthen their association, by means of a method we term bridging source and target word embeddings. We experiment with three strategies: (1) a source-side bridging model, where source word embeddings are moved one step closer to the output target sequence; (2) a target-side bridging model, which explores the more relevant source word embeddings for the prediction of the target sequence; and (3) a direct bridging model, which directly connects source and target word embeddings seeking to minimize errors in the translation of ones by the others. Experiments and analysis presented in this paper demonstrate that the proposed bridging models are able to significantly improve quality of both sentence translation, in general, and alignment and translation of individual source words with target words, in particular.

연구 동기 및 목표

  • 원천어 및 목적어 단어가 긴 은닉 상태 시퀀스 동안 의미적 연결을 상실하는 NMT에서의 열악한 어휘 대응 문제를 해결하기 위해.
  • SMT에서는 드물지만 NMT에서는 흔히 발생하는 잘못된 대응—예를 들어 'eos'를 'late'와 대응시키거나 'winter olympics'를 쉼표와 대응시키는 것—을 줄이기 위해.
  • SMT 어휘 대응 또는 어휘 표와 같은 외부 자원에 의존하지 않고도 원천 및 목적어 단어 임베딩 간의 유사성을 강화하기 위해.
  • 학습 데이터에서 직접 더 타당한 번역 쌍을 학습할 수 있도록 하여 번역 품질을 향상시키기 위해.

제안 방법

  • 원천 측 브리지: 각 원천어 임베딩을 그에 해당하는 원천 은닉 상태와 연결하여 주의 집중을 관련 원천어에 더 잘 향하게 한다.
  • 목적어 측 브리지: 주의 가중치를 기반으로 높은 주의를 받는 원천어를 선별하고, 디코딩 중에 이를 목적어 은닉 상태와 더 밀접하게 통합한다.
  • 직접 브리지: 원천 임베딩을 직접 목적어 임베딩으로 매핑하는 선형 변환 행렬을 학습하여 번역 오차를 최소화한다.
  • 브리지 메커니즘은 표준 seq2seq NMT 아키텍처에 최소한의 아키텍처 변경으로 통합되어 엔드 투 엔드 학습을 유지한다.
  • 모든 모델은 추가 지도 학습이나 사전 학습된 대응 데이터 없이 표준 NMT 목표 함수를 사용해 엔드 투 엔드로 학습된다.
  • 직접 브리지 모델은 각 원천어에 대해 가장 가까운 목적어 임베딩을 찾는 학습된 변환 행렬을 사용하여 SMT 어휘 표를 모방한다.

실험 결과

연구 질문

  • RQ1NMT 처리 체인에서 원천어 및 목적어 단어 임베딩 간 거리를 줄이면 어휘 대응 품질이 향상되는가?
  • RQ2원천어 및 목적어 임베딩을 브리지함으로써 NMT에서 과도 번역 및 부족 번역 문제를 줄일 수 있는가?
  • RQ3외부 SMT 어휘 대응 또는 어휘 사전에 의존하지 않고도 모델이 더 정확한 번역 쌍을 학습할 수 있는가?
  • RQ4원천 측, 목적어 측, 직접 브리지와 같은 다양한 브리지 전략이 어휘 대응 및 번역 품질 향상에 어떻게 비교되는가?

주요 결과

  • 제안된 브리지 모델들은 중국어-영어 번역에서 표준 NMT 베이스라인을 능가하는 번역 품질을 크게 향상시킨다.
  • 직접 브리지 모델은 SMT 어휘 표의 번역 쌍과 매우 일치하는 번역 쌍을 생성하여 타당한 번역 등가물과의 강한 대응을 보여준다.
  • 모델들은 잘못된 대응의 빈도를 줄이며, 예를 들어 표준 NMT 베이스라인에서 최대 50%의 경우에 발생하는 'eos'를 'late'와 대응시키거나 'winter olympics'를 쉼표와 대응시키는 등의 오류를 감소시킨다.
  • 실험 결과 브리지 메커니즘이 어휘 대응 품질을 향상시키고 과도 및 부족 번역 문제를 완화함을 보여준다.
  • 직접 브리지 모델은 원천 임베딩을 그에 가장 적합한 목적어 대응물로 효과적으로 매핑하는 변환 행렬을 학습하며, 번역 등가성의 개념을 잘 포착하는 강력한 능력을 보여준다.
  • 분석 결과 브리지 방법이 모델이 더 유리한 원천-목적어 어휘 쌍을 학습하도록 도와주며, 전반적인 번역 품질과 국소적 대응 정확도를 모두 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.