Skip to main content
QUICK REVIEW

[논문 리뷰] Recurrent Neural Machine Translation

Biao Zhang, Deyi Xiong|arXiv (Cornell University)|2016. 07. 29.
Natural Language Processing Techniques참고 문헌 26인용 수 9
한 줄 요약

이 논문은 표준 어휘 기반 신경 기계 번역(NMT) 모델의 한계를 보완하기 위해, 표준 어휘 메커니즘을 대체하는 컨텍스터(contexter)를 도입한 순환 신경망 기반 기계 번역(RNMT) 모델을 제안한다. 컨텍스터는 목표 문장의 이전 은닉 상태를 초기 상태로 사용하고, 소스 어노테이션을 입력으로 받아 장기적 의존성을 더 잘 포착할 수 있도록 설계되었다. 중국어-영어 번역 작업에서의 실험 결과, RNMT는 특히 장문의 문장에서 표준 어휘 기반 NMT를 능가하며, 컨텍스터 구성요소를 통해 암묵적으로 번역 일치를 모델링함을 확인하였다.

ABSTRACT

The vanilla attention-based neural machine translation has achieved promising performance because of its capability in leveraging varying-length source annotations. However, this model still suffers from failures in long sentence translation, for its incapability in capturing long-term dependencies. In this paper, we propose a novel recurrent neural machine translation (RNMT), which not only preserves the ability to model varying-length source annotations but also better captures long-term dependencies. Instead of the conventional attention mechanism, RNMT employs a recurrent neural network to extract the context vector, where the target-side previous hidden state serves as its initial state, and the source annotations serve as its inputs. We refer to this new component as contexter. As the encoder, contexter and decoder in our model are all derivable recurrent neural networks, our model can still be trained end-to-end on large-scale corpus via stochastic algorithms. Experiments on Chinese-English translation tasks demonstrate the superiority of our model to attention-based neural machine translation, especially on long sentences. Besides, further analysis of the contexter revels that our model can implicitly reflect the alignment to source sentence.

연구 동기 및 목표

  • 장문 번역에서 장기적 의존성 모델링 능력이 열악한 어휘 기반 신경 기계 번역의 한계를 해결하기 위해.
  • 가변 길이의 소스 문장 처리 능력을 유지하면서도 맥락 모델링 능력을 향상시키기 위해.
  • 에ncoder, 컨텍스터, 디코더에 순환 구성요소를 사용하여 미분 가능하고 종단 간(end-to-end) 학습이 가능한 아키텍처를 개발하기 위해.
  • 짧은 문장 번역 성능을 희생시키지 않은 채 장문 번역 품질을 향상시키기 위해.
  • 컨텍스터가 소스 문장과 목표 문장 간의 일치 관계를 암묵적으로 반영하는지 조사하기 위해.

제안 방법

  • 표준 어휘 메커니즘을 컨텍스터로 대체한다. 컨텍스터는 소스 어노테이션을 입력으로 받고, 목표 문장의 이전 은닉 상태를 초기 은닉 상태로 사용한다.
  • 컨텍스터를 통해 표준 어휘보다 더 효과적으로 장거리 의존성을 포착하는 컨텍스트 벡터를 생성한다.
  • 에ncoder, 컨텍스터, 디코더를 모두 미분 가능한 순환 네트워크로 설계하여 확률적 최적화 방법을 통한 종단 간 학습을 가능하게 한다.
  • 스토하스틱 경사 하강법 또는 유사한 방법을 사용하여 대규모 병렬 코퍼스에서 전체 모델을 학습시킨다.
  • 컨텍스터의 순환 구조를 활용해 시간 단계를 거쳐 은닉 상태를 유지하고 갱신함으로써 동적 맥락 집합을 가능하게 한다.
  • 컨텍스터의 순환 동역학을 통해 일치 패턴을 학습함으로써 암묵적으로 일치 관계를 모델링할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1표준 어휘 메커니즘과 비교해 볼 때, 순환 기반 컨텍스트 벡터 생성 기법이 장문 번역 성능 향상에 기여하는가?
  • RQ2제안된 컨텍스터 구성요소가 기존 어휘 메커니즘보다 소스 문장의 장기적 의존성을 더 잘 포착하는가?
  • RQ3명시적인 일치 모델링 없이도 컨텍스터가 소스 문장과 목표 문장 간의 일치 관계를 암묵적으로 반영하는가?
  • RQ4중국어-영어 번역 작업에서 RNMT 모델은 표준 어휘 기반 NMT보다 장문 번역에서 어떻게 성능을 내는가?
  • RQ5컨텍스터 구성요소가 모델의 나머지 부분과 함께 종단 간으로 학습 가능하며 성능 향상도 유지되는가?

주요 결과

  • RNMT 모델은 특히 장문의 문장에서 표준 어휘 기반 NMT보다 뛰어난 번역 성능을 달성한다.
  • 컨텍스터 구성요소는 시간 단계를 거쳐 은닉 상태를 유지하고 갱신함으로써 장기적 의존성을 효과적으로 모델링한다.
  • 컨텍스터의 동역학을 통해 소스 문장과 목표 문장 간의 일치 관계를 암묵적으로 반영한다.
  • 에러 전파 가능한 순환 구성요소 덕분에 RNMT 모델은 확률적 최적화 알고리즘을 사용해 종단 간으로 학습이 가능하다.
  • 중국어-영어 번역 작업에서의 실험 결과, RNMT는 장문 처리 능력에서 기준 모델을 능가함을 확인하였다.
  • 컨텍스터의 순환 구조는 장문 맥락 환경에서 표준 어휘 메커니즘보다 더 효과적인 맥락 집합을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.