Skip to main content
QUICK REVIEW

[논문 리뷰] Data Augmentation to Address Out-of-Vocabulary Problem in Low-Resource Sinhala-English Neural Machine Translation

Aloka Fernando, Surangika Ranathunga|arXiv (Cornell University)|2022. 05. 18.
Natural Language Processing Techniques인용 수 6
한 줄 요약

이 논문은 저자원 시늘라-영어 신경 기계 번역(NMT)을 위한 새로운 데이터 증강(DA) 기법을 제안하며, 문법적 및 의미적 제약 조건을 유지하면서 단어와 구문을 대체하여 희귀어 및 어휘 외 단어(OOV) 문제를 동시에 해결한다. 이 방법은 번역 성능을 향상시키며, 의미적 제약 조건만으로도 문법적 제약 조건과 유사한 성능을 달성하고, 둘을 결합할 경우 더 큰 향상 효과를 보이며, 특히 언어학적 도구가 부족한 저자원 언어에 매우 유용하다.

ABSTRACT

Out-of-Vocabulary (OOV) is a problem for Neural Machine Translation (NMT). OOV refers to words with a low occurrence in the training data, or to those that are absent from the training data. To alleviate this, word or phrase-based Data Augmentation (DA) techniques have been used. However, existing DA techniques have addressed only one of these OOV types and limit to considering either syntactic constraints or semantic constraints. We present a word and phrase replacement-based DA technique that consider both types of OOV, by augmenting (1) rare words in the existing parallel corpus, and (2) new words from a bilingual dictionary. During augmentation, we consider both syntactic and semantic properties of the words to guarantee fluency in the synthetic sentences. This technique was experimented with low resource Sinhala-English language pair. We observe with only semantic constraints in the DA, the results are comparable with the scores obtained considering syntactic constraints, and is favourable for low-resourced languages that lacks linguistic tool support. Additionally, results can be further improved by considering both syntactic and semantic constraints.

연구 동기 및 목표

  • 저자원 시늘라-영어 신경 기계 번역(NMT)에서 어휘 외 단어(OOV) 문제를 해결하기 위해.
  • 훈련 데이터 내 희귀어와 번역 사전에서 제공하는 완전히 새로운 OOV 단어를 모두 처리할 수 있는 데이터 증강 기법을 개발하기 위해.
  • 단어/구문 대체 과정에서 문법적 및 의미적 제약 조건을 동시에 고려하여 증강된 문장의 유창성을 확보하기 위해.
  • 제한된 언어학적 도구 지원 환경에서 의미적 제약 조건 단독, 문법적 제약 조건 단독, 그리고 둘을 조합한 경우의 번역 품질에 대한 영향을 평가하기 위해.
  • 의미적 제약 조건 단독으로도 경쟁 가능한 성능을 달성할 수 있음을 입증하여, 저자원 언어에서 복잡한 문법 도구에 대한 의존도를 줄이기 위해.

제안 방법

  • 이 방법은 이중어사전을 활용하여 병렬 문장 내 단어 및 구문을 대체함으로써 새로운 OOV 단어를 도입한다.
  • 의미적 제약 조건을 위해 단어 임베딩을 활용하여 대체된 단어가 원래 단어와 의미적으로 유사하도록 보장한다.
  • 문법적 제약 조건을 위해 품사 태깅(POS tagging)을 사용하여 증강된 문장의 문법적 정확성을 유지한다.
  • 증강 과정은 의미와 문법적 구조를 모두 유지하는 합성 병렬 문장을 생성한다.
  • 표준 BLEU 점수를 사용하여 저자원 시늘라-영어 NMT 설정에서 이 방법을 평가한다.
  • 의미적 및 문법적 제약 조건을 개별적으로 적용하고, 동시에 적용하여 번역 품질에 미치는 영향을 평가한다.

실험 결과

연구 질문

  • RQ1의미적 및 문법적 제약 조건을 함께 적용함으로써, 희귀어 및 새로운 OOV 단어를 증강함으로써 저자원 시늘라-영어 NMT에서 OOV 문제를 효과적으로 줄일 수 있는가?
  • RQ2의미적 제약 조건 단독과 문법적 제약 조건 단독이 저자원 환경에서 유창성과 번역 품질을 유지하는 데 얼마나 효과적인가?
  • RQ3의미적 제약 조건과 문법적 제약 조건을 동시에 적용할 경우, 각각을 별도로 적용했을 때보다 번역 성능 향상 정도는 어느 정도인가?
  • RQ4의미 유사도 기반 데이터 증강 방법이 복잡한 문법 도구가 없더라도 경쟁 가능한 성능을 달성할 수 있는가?

주요 결과

  • 의미적 제약 조건 단독을 사용한 데이터 증강에서도 문법적 제약 조건을 사용한 경우와 유사한 BLEU 점수를 달성하여 의미적 제약 조건 단독 접근의 타당성을 입증한다.
  • 의미적 및 문법적 제약 조건을 함께 적용할 경우 번역 성능 향상이 더욱 두드러지며, 이는 상호 보완적 이점이 있음을 시사한다.
  • 의미적으로 타당하고 유창한 대체를 통해 희귀어 및 새로운 OOV 단어를 효과적으로 도입함으로써 OOV 문제를 줄이는 데 성공한다.
  • 의미적 제약 조건 단독으로도 의미 있는 성능 향상을 이룰 수 있으며, 특히 POS 태거나 파서와 같은 언어학적 도구가 부족하거나 없어도 효과적인 저자원 언어인 시늘라어에 특히 유용하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.