Skip to main content
QUICK REVIEW

[논문 리뷰] Incorporating Word and Subword Units in Unsupervised Machine Translation Using Language Model Rescoring

Zihan Liu, Yan Xu|arXiv (Cornell University)|2019. 08. 16.
Natural Language Processing Techniques참고 문헌 26인용 수 6
한 줄 요약

이 논문은 독일어와 체코어와 같은 형태적 풍부한 언어를 위한 비병렬 데이터 기반 비지도 신경 기계 번역에서 어절 수준 및 서브어절 수준 표현을 결합하는 방법을 제안한다. MUSE로 정렬된 임베딩과 언어 모델 재평가 기법을 사용하며, WMT'19 공동 과제에서 번역 품질이 10.6 BLEU 향상되었고, 주요 성과는 알 수 없는 단어 대체 및 재평가 기법 덕분이며, 병렬 데이터 없이도 성취되었다.

ABSTRACT

This paper describes CAiRE's submission to the unsupervised machine translation track of the WMT'19 news shared task from German to Czech. We leverage a phrase-based statistical machine translation (PBSMT) model and a pre-trained language model to combine word-level neural machine translation (NMT) and subword-level NMT models without using any parallel data. We propose to solve the morphological richness problem of languages by training byte-pair encoding (BPE) embeddings for German and Czech separately, and they are aligned using MUSE (Conneau et al., 2018). To ensure the fluency and consistency of translations, a rescoring mechanism is proposed that reuses the pre-trained language model to select the translation candidates generated through beam search. Moreover, a series of pre-processing and post-processing approaches are applied to improve the quality of final translations.

연구 동기 및 목표

  • 형태적 풍부한 언어인 독일어와 체코어를 위한 비지도 기계 번역에서 외부어어휘(OOV) 문제를 해결한다.
  • 병렬 데이터 없이 어절 수준 및 서브어절 수준 표현을 통합하여 번역의 유창성과 일관성을 향상시킨다.
  • 구문 기반 SMT와 역번역을 활용해 가짜 병렬 데이터를 활용함으로써 병렬 코퍼스 의존도를 낮춘다.
  • 사전 처리, 후처리 및 언어 모델 기반 재평가를 통해 번역 품질을 향상시킨다.
  • 비지도 환경에서 알 수 없는 단어 대체 및 언어 모델 재평가의 효과를 평가한다.

제안 방법

  • 독일어와 체코어에 대해 별도의 FastText 어절 임베딩을 학습한 후, MUSE를 사용해 공유된 공간으로 정렬하여 OOV 문제를 줄인다.
  • 노이즈가 섞인 문장에서 재구성 오차를 최소화하기 위해 소음 제거 오토인코더 언어 모델을 사용하여 문장 수준의 유창성을 향상시킨다.
  • 구문 기반 SMT 모델을 사용해 역번역을 수행하여 가짜 병렬 데이터를 생성하고, 어절 수준 및 서브어절 수준 NMT 모델을 모두 미세조정한다.
  • 어절 수준 NMT 출력에서 OOV 토큰을 타겟 쪽에서 유사한 대체어로 대체하는 알 수 없는 단어 대체(UWR)를 구현한다.
  • 미세조정된 사전 학습된 체코어 언어 모델을 사용해 빔 서치 후보를 재평가하여 가장 유창하고 일관성 있는 번역을 선택한다.
  • 어절 수준 및 서브어절 수준 NMT 모델의 앙상블을 구성하고, 추가로 패치업 후처리 단계를 적용하여 향상시킨다.

실험 결과

연구 질문

  • RQ1형태적 풍부한 언어에서 어절 수준 및 서브어절 수준 표현을 통합하면 비지도 번역 성능이 향상되는가?
  • RQ2빔 서치에서 더 높은 품질의 번역 후보를 선택하는 데 언어 모델 재평가 기법이 얼마나 효과적인가?
  • RQ3알 수 없는 단어 대체가 어절 수준 비지도 NMT에서 OOV 문제를 어느 정도 완화하는가?
  • RQ4MUSE로 정렬된 다국어 임베딩이 비지도 NMT의 초기화 및 성능에 기여하는가?
  • RQ5사전 처리, 후처리 및 재평가의 조합이 병렬 데이터 없이 BLEU 점수를 크게 향상시킬 수 있는가?

주요 결과

  • 기본 설정에서 서브어절 수준 NMT 모델이 어절 수준 모델보다 약 1.5 BLEU 포인트 높은 성능을 보였다.
  • 어절 수준 NMT 모델에 알 수 없는 단어 대체를 적용한 결과 BLEU 점수가 약 2.2 포인트 향상되어 10.1 BLEU에 도달했다.
  • 언어 모델 재평가로 어절 수준 NMT 모델의 BLEU 점수가 0.3 포인트 향상되었으며, UWR 및 미세조정 이후에 적용할 경우 추가로 성능 향상이 있었다.
  • 최고의 어절 수준 및 서브어절 수준 NMT 모델의 앙상블이 WMT'19 테스트 세트에서 최고의 BLEU 점수 10.6을 기록했다.
  • 패치업 후처리 단계를 적용한 결과 앙상블 모델의 BLEU 점수는 10.6으로 약간 향상되었고, TER는 0.829에서 0.833으로 감소하여 일관성 향상을 보였다.
  • 최종 시스템은 대문자 처리 평가에서 10.2 BLEU를 기록하여 병렬 데이터 없이 형태학적으로 복잡한 언어 쌍에서도 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.