Skip to main content
QUICK REVIEW

[논문 리뷰] Improving the Performance of Neural Machine Translation Involving Morphologically Rich Languages

Hans Krupakar, R. S. Milton|arXiv (Cornell University)|2016. 12. 07.
Topic Modeling참고 문헌 30인용 수 12
한 줄 요약

이 논문은 신경 기계 번역(NMT) 이전에 히브리어, 타밀어와 같은 형태적 풍부한 언어의 형태소 분할을 제안하여 성능을 향상시킵니다. 단어를 벡터화하기 전에 형태소로 분할함으로써 모델은 어휘 크기를 8배 줄이고 기준 RNNSearch 대비 BLEU 점수를 7.05점 향상시켰으며, 동시에 어텐션 메커니즘의 효율성과 인간 평가 기준의 유창성 및 적절성도 향상시켰습니다.

ABSTRACT

The advent of the attention mechanism in neural machine translation models has improved the performance of machine translation systems by enabling selective lookup into the source sentence. In this paper, the efficiencies of translation using bidirectional encoder attention decoder models were studied with respect to translation involving morphologically rich languages. The English - Tamil language pair was selected for this analysis. First, the use of Word2Vec embedding for both the English and Tamil words improved the translation results by 0.73 BLEU points over the baseline RNNSearch model with 4.84 BLEU score. The use of morphological segmentation before word vectorization to split the morphologically rich Tamil words into their respective morphemes before the translation, caused a reduction in the target vocabulary size by a factor of 8. Also, this model (RNNMorph) improved the performance of neural machine translation by 7.05 BLEU points over the RNNSearch model used over the same corpus. Since the BLEU evaluation of the RNNMorph model might be unreliable due to an increase in the number of matching tokens per sentence, the performances of the translations were also compared by means of human evaluation metrics of adequacy, fluency and relative ranking. Further, the use of morphological segmentation also improved the efficacy of the attention mechanism.

연구 동기 및 목표

  • 형태적 풍부한 언어인 타밀어를 포함한 신경 기계 번역(NMT)에서 낮은 성능 문제를 해결하기 위해.
  • 번역 이전에 복잡한 단어를 형태소로 분할하여 어휘 크기를 줄이고 일반화 능력을 향상시키기 위해.
  • BLEU 외에도 인간 평가를 통해 유창성, 적절성 및 상대 순위를 포함한 번역 품질 평가를 수행하기 위해.
  • 형태소 분할이 순서에서 순서 모델의 어텐션 메커니즘 효과성을 높이는지 조사하기 위해.
  • 원천 측면의 분할 및 향후 대상 측면의 집약을 포함하는 프레임워크를 제안하여 형태적 풍부한 언어에 대한 엔드 투 엔드 NMT를 가능하게 하기 위해.

제안 방법

  • 영어-타밀어 번역을 위한 양방향 LSTM 인코더-디코더 모델을 어텐션 메커니즘과 함께 적용하기 위해.
  • 벡터 표현을 향상시키기 위해 영어 및 타밀어 단어 모두에 Word2Vec 임베딩을 사용하기 위해.
  • 단어 벡터화 이전에 타밀어 단어를 그 구성 형태소로 형태소 분할하기 위해.
  • 어휘 표현의 맥락을 풍부하게 하기 위해 UTF-8 인코딩을 사용한 별도의 단일 언어 타밀어 코퍼스(567,772문장)를 훈련하기 위해.
  • 뉴스, 성경, 자막, 관광 및 문학 자료에서 유래한 병합 다국어 코퍼스(197,792문장)를 사용해 모델을 훈련하기 위해.
  • BLEU, 인간 평가(유창성, 적절성, 순위), 어텐션 메커니즘 행동 분석을 통해 결과를 평가하기 위해.

실험 결과

연구 질문

  • RQ1형태적 풍부한 언어인 타밀어의 형태소 분할이 BLEU 점수 및 인간 평가 지표 측면에서 NMT 성능 향상에 기여하는가?
  • RQ2형태소 분할이 자원이 적은 환경에서 어휘 크기와 모델 일반화에 어떤 영향을 미치는가?
  • RQ3형태소 분할이 순서에서 순서 모델의 어텐션 메커니즘 효과성에 어느 정도 기여하는가?
  • RQ4형태학적으로 복잡한 언어 번역에서 인간 평가 지표인 유창성 및 적절성이 BLEU보다 더 신뢰할 수 있는 성능 평가 도구가 될 수 있는가?
  • RQ5코퍼스의 다양성과 도메인 특수성은 형태적 풍부한 언어에 대한 NMT 모델의 강건성에 어떤 영향을 미치는가?

주요 결과

  • 형태소 분할은 대상 어휘 크기를 8배 줄여 모델의 효율성과 일반화 능력을 크게 향상시켰다.
  • 형태소 분할을 적용한 RNNMorph 모델은 기준 RNNSearch 모델(4.84 BLEU) 대비 7.05 BLEU 점수 향상을 기록했다.
  • 인간 평가 결과 RNNMorph 모델이 기준 모델 대비 유창성, 적절성 및 상대 순위에서 뛰어난 성능을 보여 번역 품질이 높다는 것을 확인했다.
  • 분할 이후 어텐션 메커니즘이 더욱 효과적으로 작동했으며, 이는 원천 문장 표현에 대한 선택적 액세스 향상으로 입증되었다.
  • 큰 단일 언어 타밀어 코퍼스의 사용은 단어 벡터의 풍부함을 높였고, 대상 측면의 언어 모델링을 지원했다.
  • 분할으로 인한 평균 문장 길이 증가에도 불구하고 어텐션 메커니즘은 긴 시퀀스를 효과적으로 처리하여 번역 품질을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.