Skip to main content
QUICK REVIEW

[논문 리뷰] Bi-Directional Neural Machine Translation with Synthetic Parallel Data

Xing Niu, Michael Denkowski|arXiv (Cornell University)|2018. 05. 29.
Natural Language Processing Techniques참고 문헌 29인용 수 10
한 줄 요약

이 논문은 단방향 병렬 데이터에서 유도된 단방향 코퍼스로부터 생성된 합성 병렬 데이터를 사용하여 양방향 신경 기계 번역 모델을 제안한다. 단일 모델을 통해 양방향 번역을 동시에 학습하고, 역번역된 단방향 문장을 반복적으로 증강함으로써, 단방향 모델에 비해 학습 및 구현 비용을 줄이며 저자원 및 도메인 외부 설정에서 번역 품질을 향상시킨다.

ABSTRACT

Despite impressive progress in high-resource settings, Neural Machine Translation (NMT) still struggles in low-resource and out-of-domain scenarios, often failing to match the quality of phrase-based translation. We propose a novel technique that combines back-translation and multilingual NMT to improve performance in these difficult cases. Our technique trains a single model for both directions of a language pair, allowing us to back-translate source or target monolingual data without requiring an auxiliary model. We then continue training on the augmented parallel data, enabling a cycle of improvement for a single model that can incorporate any source, target, or parallel data to improve both translation directions. As a byproduct, these models can reduce training and deployment costs significantly compared to uni-directional models. Extensive experiments show that our technique outperforms standard back-translation in low-resource scenarios, improves quality on cross-domain tasks, and effectively reduces costs across the board.

연구 동기 및 목표

  • 병렬 데이터가 부족한 저자원 및 도메인 외부 번역 시나리오에서 NMT의 성능 격차를 해소하기 위해.
  • 아키텍처 변경 없이도 단방향 데이터를 통합할 수 있는 표준 NMT 모델의 한계를 극복하기 위해.
  • 단일 모델에 두 방향 번역을 통합함으로써 학습 및 구현 비용을 줄이기 위해.
  • 원본 및 대상 단방향 코퍼스로부터 유도된 합성 데이터를 사용한 반복적 역번역을 통해 번역 품질을 향상시키기 위해.
  • 성능 향상을 극대화하기 위해 단방향 데이터 및 합성 데이터 조합을 선택하는 최적의 전략 수립하기 위해.

제안 방법

  • 원본 및 뒤집힌 소스-타겟 문장 쌍을 포함한 균형 잡힌 데이터셋에 대해 다국어 NMT 모델을 학습하며, 방향을 나타내기 위해 언어별 토큰(예: $<$2en$>$)을 사용한다.
  • 학습된 양방향 모델을 사용해 원본 및 대상 단방향 데이터를 양방향 합성 병렬 문장으로 번역한다.
  • 기존 병렬 학습 데이터에 합성 문장 쌍을 추가하고 동일한 모델을 계속 학습함으로써 향상 주기를 구현한다.
  • 어휘 임베딩을 소스 및 대상 언어 간에 연결하고, 공유된 바이트-페어 인코딩(BPE) 서브워드 분할을 사용하여 어휘 크기와 모델 복잡도를 줄인다.
  • 교차 엔트로피 차이를 사용해 도메인 내 데이터와 유사하지만 일반 도메인 단방향 코퍼스와는 다름을 보이는 문장을 식별함으로써 고품질 단방향 데이터를 선별한다.
  • 실제 단방향 데이터가 항상 합성 데이터 생성 중 타겟 측면에 존재하도록 보장함으로써 모델 성능 저하를 방지하고, 디코더 파라미터를 동 冻결할 필요 없이 구현한다.

실험 결과

연구 질문

  • RQ1단일 양방향 NMT 모델이 소스 및 대상 언어의 단방향 데이터를 효과적으로 활용하여 번역 품질을 향상시킬 수 있는가?
  • RQ2합성 데이터를 사용해 양방향을 함께 학습하는 것이 별도의 역방향 모델을 사용하는 표준 역번역보다 저자원 환경에서 성능이 뛰어나지 않는가?
  • RQ3단방향 모델에 비해 이 방법이 학습 및 구현 비용을 얼마나 줄일 수 있는가?
  • RQ4현대어에서 성경 히브리어로의 번역과 같은 도메인 간 번역 과제에서 이 방법의 효과는 어떠한가?
  • RQ5합성 데이터 증강에서 성능 향상을 극대화하기 위해 단방향 데이터 선택의 최적 전략은 무엇인가?

주요 결과

  • 증강된 데이터로 미세조정한 후 성경 번역 과제에서 BLEU 점수를 70-130% 상승시켜 매우 약한 베이스라인에서 출발함에도 불구하고 성과를 달성했다.
  • 저자원 환경에서 표준 역번역보다 모델 성능이 뛰어나며, 보조 모델이 필요 없이 일관된 성능 향상을 보였다.
  • 어휘가 없는 단어 비율이 30%를 초과하는 현대 영어에서 성경 히브리어로의 번역과 같은 도메인 간 과제에서 번역 품질이 크게 향상되었다.
  • 양방향 번역을 단일 모델에 통합함으로써 학습 및 구현 비용을 크게 절감했다.
  • 교차 엔트로피 차이를 사용한 단방향 데이터 선별이 고품질 데이터를 식별하여 더 나은 합성 데이터와 모델 성능 향상에 기여했다.
  • 모델 파라미터를 동 冻결하거나 아키텍처 수정 없이도 소스 및 대상 단방향 데이터를 효과적으로 활용했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.