Skip to main content
QUICK REVIEW

[논문 리뷰] Synthetic Data for Neural Machine Translation of Spoken-Dialects

Hany Hassan, Mostafa ElAraby|arXiv (Cornell University)|2017. 07. 01.
Natural Language Processing Techniques참고 문헌 4인용 수 14
한 줄 요약

이 논문은 자료가 풍부한 언어(예: 현대 표준 아랍어)에서 자료가 부족한 방언(예: 레바논 아랍어)으로의 단어 임베딩 투영과 소량의 시드 병렬 코퍼스를 활용하여 신경 기계 번역(NMT)을 위한 합성 병렬 데이터를 생성하는 언어 독립적 방법을 제안한다. 단일 언어 임베딩과 근접한 근접 이웃(ANN)을 통해 자료가 풍부한 언어의 단어를 자료가 부족한 방언으로 투영함으로써, 레바논 아랍어-영어 번역에서 NMT 성능을 2.8 BLEU 포인트 향상시켰으며, 방언에 대한 병렬 학습 데이터가 없더라도 고성능 번역을 가능하게 한다.

ABSTRACT

In this paper, we introduce a novel approach to generate synthetic data for training Neural Machine Translation systems. The proposed approach transforms a given parallel corpus between a written language and a target language to a parallel corpus between a spoken dialect variant and the target language. Our approach is language independent and can be used to generate data for any variant of the source language such as slang or spoken dialect or even for a different language that is closely related to the source language. The proposed approach is based on local embedding projection of distributed representations which utilizes monolingual embeddings to transform parallel data across language variants. We report experimental results on Levantine to English translation using Neural Machine Translation. We show that the generated data can improve a very large scale system by more than 2.8 Bleu points using synthetic spoken data which shows that it can be used to provide a reliable translation system for a spoken dialect that does not have sufficient parallel data.

연구 동기 및 목표

  • 신경 기계 번역(NMT)에서 구어체 방언에 대한 병렬 학습 데이터 부족 문제를 해결하기 위해.
  • 소량의 시드 병렬 코퍼스와 단일 언어 데이터만을 사용하여 자료가 부족한 구어체 방언의 고성능 번역을 가능하게 하기 위해.
  • 어떤 관련 언어 변형 또는 방언에도 적용 가능한 언어 독립적 접근법을 개발하여 합성 병렬 데이터를 생성하기 위해.
  • 초기 학습부터 재학습하지 않고도 대규모 NMT 시스템의 방언 번역 성능을 향상시키기 위해.
  • 개방형 도메인, 자료가 부족한 방언 번역에서 합성 데이터의 효과를 평가하기 위해.

제안 방법

  • 원천 언어, 목표 언어, 방언에 대해 사전에 학습된 단일 언어 단어 임베딩(예: word2vec)을 활용한다.
  • 방언과 표준어 또는 목표 언어 간의 소량의 이중 어휘 사전 또는 병렬 데이터를 사용하여 국지화된 임베딩 투영을 학습한다.
  • 학습된 투영을 사용하여 근접한 근접 이웃(ANN) 검색을 통해 원천 언어의 단어를 그 방언에 해당하는 단어로 매핑한다.
  • 세 방향 병렬 코퍼스(방언, 표준어, 목표 언어)를 구성하여 데이터 증강 및 다단계 번역 파이프라인을 가능하게 한다.
  • 합성된 방언-목표 언어 병렬 데이터를 사용하여 대규모 NMT 시스템을 학습하거나 미세조정한다. 이는 학습에 추가하거나 사전 학습된 모델 학습을 계속하는 방식으로 수행된다.
  • 영어로의 번역 성능을 평가하기 위해 방언-목표 언어 및 표준어-목표 언어 테스트 세트를 모두 사용하여 제로샷 및 도메인 내 일반화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1임베딩 투영을 통해 생성된 합성 병렬 데이터가 자료가 부족한 구어체 방언의 NMT 성능을 크게 향상시킬 수 있는가?
  • RQ2인간이 번역한 MSA 데이터를 사용한 오라클 시스템과 비교했을 때, 합성 데이터로 학습된 대규모 NMT 시스템의 성능은 어떠한가?
  • RQ3합성 데이터는 표준어 테스트 세트에서의 성능을 떨어뜨리지 않고 번역 품질을 향상시키는가?
  • RQ4레바논 아랍어와 같이 병렬 데이터가 극히 적은 방언에도 이 방법이 효과적으로 적용될 수 있는가?
  • RQ5이 방법은 언어 독립적이며 다른 방언이나 언어 변형으로도 이식 가능한가?

주요 결과

  • 대규모 NMT 시스템에 200만 개의 합성 레바논 아랍어-영어 문장을 추가함으로써, 레바논 아랍어-영어 테스트 세트에서 BLEU 점수가 25.03에서 27.91로 2.8 포인트 향상되었다.
  • 합성 데이터로 학습된 시스템은 레바논 아랍어-영어 번역에서 BLEU 점수 27.91을 기록했으며, 인간이 번역한 MSA-영어 데이터를 사용한 오라클 시스템의 28.20 점에 비해 단지 0.3 포인트 미만이었다.
  • 합성 데이터는 표준 MSA-영어 NIST-08 테스트 세트에서 성능을 떨어뜨리지 않았으며, 기본 시스템의 53.45 점과 비교해 53.42 점을 유지했다.
  • 사전 학습된 시스템을 합성 데이터로 미세조정한 결과 BLEU 점수는 27.37을 기록했으며, 이는 중간 정도의 향상이었지만 전체 재학습보다는 낮았다.
  • 조금의 어휘 겹침(58%)이 있는 방언과 표준어 간에도 의미 있고 사용 가능한 합성 데이터를 성공적으로 생성했으며, 부적절한 단어 교체를 방지했다.
  • 이 방법은 하나의 NMT 시스템이 문어체와 구어체 변형을 효과적으로 처리할 수 있도록 했으며, 입력 변동에 대한 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.