Skip to main content
QUICK REVIEW

[논문 리뷰] A Hybrid Morpheme-Word Representation for Machine Translation of Morphologically Rich Languages

Minh-Thang Luong, Preslav Nakov|arXiv (Cornell University)|2019. 11. 19.
Natural Language Processing Techniques참고 문헌 27인용 수 43
한 줄 요약

본 논문은 morpheme 수준 번역에 단어 경계 인식을 갖춘 언어 독립 하이브리드 모르펨-단어 SMT 모델을 제시하고, 쌍둥이 언어 모델과 구문표 병합을 결합하여 영어-핀란드어 번역을 향상시킵니다.

ABSTRACT

We propose a language-independent approach for improving statistical machine translation for morphologically rich languages using a hybrid morpheme-word representation where the basic unit of translation is the morpheme, but word boundaries are respected at all stages of the translation process. Our model extends the classic phrase-based model by means of (1) word boundary-aware morpheme-level phrase extraction, (2) minimum error-rate training for a morpheme-level translation model using word-level BLEU, and (3) joint scoring with morpheme- and word-level language models. Further improvements are achieved by combining our model with the classic one. The evaluation on English to Finnish using Europarl (714K sentence pairs; 15.5M English words) shows statistically significant improvements over the classic model based on BLEU and human judgments.

연구 동기 및 목표

  • 형태소가 풍부한 언어에 대해 언어별 도구 없이 SMT를 개선하는 동기를 부여합니다.
  • 디코딩 전 과정에서 단어 경계를 존중하는 형태소 수준 번역 단위를 도입합니다.
  • 워드 토큰 수준의 디코딩을 위해 쌍둥이 형태소 토큰 LM과 워드 토큰 LM을 활용하고 MERT 최적화를 수행합니다.
  • 형태소 기반 번역 표와 워드 기반 번역 표를 병합하는 방법을 개발하고 평가합니다.
  • BLEU 및 인간 평가를 사용하여 영어→핀란드어에서 Europarl 대규모 데이터로 개선을 입증합니다.

제안 방법

  • Morfessor 기반의 비지도형 형태소 분석기를 채택하여 PRE, STM, SUF 토큰을 생성합니다.
  • 7개 형태소 토큰을 초과하더라도 최대 7단어를 포함하는 경우를 허용하는 단어 경계 인식 형태소 수준 구문 추출을 구현합니다.
  • 훈련 중 BLEU 계산을 위해 형태소 토큰 출력을 단어 시퀀스로 변환하여 단어 토큰 수준에서 MERT를 수행합니다.
  • 형태소 토큰 LM과 워드 토큰 LM의 쌍둥이 언어 모델을 도입하고 디코딩 시 두 모델 모두를 점수에 반영합니다.
  • 인터폴레이션 방식의 방법과 새롭게 제시된 병합 방법을 통해 형태소 토큰 입력과 워드 토큰 입력으로부터 얻은 두 개의 구문표를 병합하고 확률적 무결성을 보존하도록 정규화합니다.
  • PT_m과 PT_w→m을 병합하여 PT_m+phr로 만드는 쌍둥이 번역 모델을 평가하고 이를 기반 시스템과 비교합니다.

실험 결과

연구 질문

  • RQ1형태소 수준 번역이 단어 경계 인식을 포함하더라도 형태소가 풍부한 언어에 대해 표준 워드 수준 SMT를 능가할 수 있는가?
  • RQ2형태소 토큰 LM을 워드 토큰 LM과 함께 도입하면 형태소가 풍부한 대상 언어의 디코딩이 향상되는가?
  • RQ3형태소 토큰과 워드 토큰 번역의 구문표를 병합하면 단일 시스템 SMT보다 추가 이점을 얻을 수 있는가?
  • RQ4영어→핀란드어에서 학습 데이터 규모가 번역 품질 향상에 어떤 영향을 미치는가?

주요 결과

  • 모르페임 기반의 개선은 모르페임 기준선 대비 BLEU를 향상시키며, 단어 수준에서의 튜닝(MERT)과 phr 및 lm의 결합이 가장 큰 개선을 제공한다.
  • 모르페임 경계선, 쌍둥이 LMs, 구문표 병합을 갖춘 전체 시스템은 BLEU 14.82 및 m-BLEU 55.64를 달성하며, 기준 시스템(BLUE 14.58, m-BLEU 53.05의 워드 기준) 및 모르페임 기준선(BLEU 14.08, m-BLEU 55.26)을 능가한다.
  • 인터폴레이션 기반 및 ourMethod 병합 접근법은 모르페임 단독 기준선 대비 크게 개선되며, ourMethod가 전체 데이터 세트에서 최고 BLEU 향상치를 달성한다(모 시스템 대비 0.74포인트).
  • 인간 평가에서도 제안 시스템이 모 시스템 및 워드 시스템보다 우수한 편입니다(쌍대 비교에서 통계적으로 유의한 선호도).
  • 분석에 따르면 번역이 참조 워드 형태에 근접한 경우가 많아 BLEU 점수 이상으로 개선이 의미 있음을 시사합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.