Skip to main content
QUICK REVIEW

[논문 리뷰] Merging External Bilingual Pairs into Neural Machine Translation

Tao Wang, Shaohui Kuang|arXiv (Cornell University)|2019. 12. 02.
Natural Language Processing Techniques참고 문헌 22인용 수 6
한 줄 요약

이 논문은 NMT 아키텍처나 디코딩 속도를 변경하지 않고, 태깅, 혼합 어절, 추가 임베딩을 통해 훈련 데이터를 수정함으로써 사전 지정된 双어어절 쌍을 신경 기계 번역(NMT)에 통합하는 데이터 중심 접근법을 제안한다. 이로 인해 지정된 어절 번역 정확도가 99% 이상에 이를 수 있었다.

ABSTRACT

As neural machine translation (NMT) is not easily amenable to explicit correction of errors, incorporating pre-specified translations into NMT is widely regarded as a non-trivial challenge. In this paper, we propose and explore three methods to endow NMT with pre-specified bilingual pairs. Instead, for instance, of modifying the beam search algorithm during decoding or making complex modifications to the attention mechanism --- mainstream approaches to tackling this challenge ---, we experiment with the training data being appropriately pre-processed to add information about pre-specified translations. Extra embeddings are also used to distinguish pre-specified tokens from the other tokens. Extensive experimentation and analysis indicate that over 99% of the pre-specified phrases are successfully translated (given a 85% baseline) and that there is also a substantive improvement in translation quality with the methods explored here.

연구 동기 및 목표

  • 엔드 투 엔드 NMT 시스템에 사전 지정된 이중어어절 쌍을 통합하는 데 도전하는 문제를 해결하기 위해, 명시적 오류 수정이 어려운 시스템에 대응한다.
  • 외부 데이터베이스에 정의된 특정 다어절 표현(예: 브랜드 이름)을 정확하고 일관되게 번역할 수 있도록 NMT를 가능하게 한다.
  • NMT 모델 아키텍처나 빔 서치 알고리즘을 수정하지 않고도 사전 지정된 어절의 번역 품질을 향상시키는 방법을 개발한다.
  • 번역 성능 향상과 함께 디코딩 속도를 유지하면서 고정된 이중어어절 표현의 성공률을 크게 높인다.
  • 훈련 데이터 사전 처리를 통해 외부 언어 지식을 NMT에 효과적이고 확장 가능하며 재현 가능한 방식으로 통합하는 방법을 탐색한다.

제안 방법

  • 태깅 방법: 소스 측 어절과 그 대응 번역어를 특수 토큰 <start>와 <end>로 감싸어, NMT 모델이 이를 학습하여 연관 짓도록 한다.
  • 혼합 어절 방법: 소스 문장을 그 소스 형태 뒤에 해당 어절의 번역어를 직접 이어붙여 증강한다(예: '我 爱 香港 hong kong'). 이는 복사 학습을 강화한다.
  • 추가 임베딩 방법: 사전 지정된 어절을 일반 토큰과 구별하기 위해 전용 임베딩 벡터를 도입한다. 이는 태깅보다 더 부드러운 신호를 제공한다.
  • 통합 방법: 태깅과 혼합 어절을 함께 사용하며, 혼합 어절 내에서 소스와 타겟을 분리하기 위해 선택적 <middle> 마커를 사용한다. 이는 정렬 학습을 향상시킨다.
  • 태그와 타겟 어절 간에 공유 임베딩을 사용하면, 더 강한 주의 메커니즘 신호를 통해 다국어 간 대응을 학습할 수 있다.
  • 모든 방법은 훈련 데이터 사전 처리 단계에서 적용되며, NMT 모델이나 디코딩 알고리즘에 대한 수정이 필요 없어 추론 속도를 유지한다.

실험 결과

연구 질문

  • RQ1단지 데이터 수준의 수정만으로 NMT가 사전 지정된 이중어어절 쌍을 고정밀도로 번역하도록 효과적으로 훈련시킬 수 있는가?
  • RQ2태깅, 혼합 어절, 추가 임베딩을 조합함으로써 기준 NMT 대비 어절 번역 성공률이 유의미하게 향상되는가?
  • RQ3제안된 방법이 모델 아키텍처나 디코딩 속도를 떨어뜨리지 않고 단어 수준과 다어절 번역 모두에서 높은 정확도를 달성할 수 있는가?
  • RQ4각 구성 요소(태깅, 혼합 어절, 추가 임베딩)가 어절 번역 성능 향상에 기여하는 방식은 무엇인가?
  • RQ5이 방법은 중국어-영어 및 영어-독일어 뉴스 번역과 같은 다양한 언어 조합과 도메인에서 견고한가?

주요 결과

  • 중국어-영어 번역에서, 사전 지정된 어절의 성공률은 문장 수준에서 기준치 74.19%에서 98.40%로, 어절 수준에서 85.03%에서 99.13%로 상승하였다.
  • 중국어-영어 번역에서, 제안된 방법은 기준치(45.7 BLEU) 대비 1.4 BLEU 포인트 향상된 성과를 달성하였다.
  • 영어-독일어 번역에서, 어절 수준의 성공률은 기준치 93.69%에서 제안된 방법을 사용해 99.54%로 향상되었다.
  • 태깅 방법은 복사 학습을 위한 학습 가능한 패턴을 만들어 주의 메커니즘의 성능을 향상시켰고, 공유 임베딩은 다국어 간 정렬을 강화시켰다.
  • 추가 임베딩 방법은 태깅보다 더 부드럽고 간섭이 적은 신호를 제공했지만, 성능 향상 폭은 더 작았다.
  • 모델 아키텍처나 디코딩 프로세스를 수정하지 않고도 사전 지정된 어절 번역 성공률가 99% 이상에 도달하였고, 추론 속도는 그대로 유지되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.