Skip to main content
QUICK REVIEW

[논문 리뷰] Generalized Data Augmentation for Low-Resource Translation

Mengzhou Xia, Xiang Kong|arXiv (Cornell University)|2019. 06. 10.
Natural Language Processing Techniques참고 문헌 33인용 수 8
한 줄 요약

이 논문은 저자원 신경 기계 번역을 위한 일반화된 데이터 증강 프레임워크를 제안한다. 이는 높은 자원 언어(HRL)를 피벗으로 활용함으로써 이루어지며, 두 단계 과정을 거친다: 첫째, 유도된 双어사전을 통해 HRL 단어를 저자원 언어(LRL) 어휘로 대체하고, 둘째, 무 supervision 기계 번역 모델을 통해 결과 문장을 보완한다. 이 방법은 네 개의 저자원 데이터셋에서 감독 기반 백번역 기준보다 번역 품질을 1.5에서 8 BLEU 포인트 향상시킨다.

ABSTRACT

Translation to or from low-resource languages LRLs poses challenges for machine translation in terms of both adequacy and fluency. Data augmentation utilizing large amounts of monolingual data is regarded as an effective way to alleviate these problems. In this paper, we propose a general framework for data augmentation in low-resource machine translation that not only uses target-side monolingual data, but also pivots through a related high-resource language HRL. Specifically, we experiment with a two-step pivoting method to convert high-resource data to the LRL, making use of available resources to better approximate the true data distribution of the LRL. First, we inject LRL words into HRL sentences through an induced bilingual dictionary. Second, we further edit these modified sentences using a modified unsupervised machine translation framework. Extensive experiments on four low-resource datasets show that under extreme low-resource settings, our data augmentation techniques improve translation quality by up to~1.5 to~8 BLEU points compared to supervised back-translation baselines

연구 동기 및 목표

  • 부족한 병렬 훈련 데이터로 인해 저자원 언어(LRL) 환경에서 번역 품질이 떨어지는 문제를 해결하기 위해.
  • 관련된 높이 자원 언어(HRL)의 단일 언어 및 병렬 데이터를 활용하여 데이터 효율성을 향상시키기 위해.
  • 사전 기반 단어 대체와 무 supervision 기계 번역을 조합한 일반화된 데이터 증강 전략을 개발하여 LRL 데이터 생성을 향상시키기 위해.
  • 영어 단일 언어 데이터와 HRL-영어 병렬 데이터를 모두 활용하여 극단적 저자원 환경에서 표준 백번역 기준을 능가하기 위해.

제안 방법

  • 매핑된 단어 임베딩 공간에서 유도된 이중어사전을 사용하여 LRL 단어를 HRL 문장에 삽입한다.
  • 수정된 무 supervision 기계 번역(m-UMT) 프레임워크를 적용하여 대체된 문장을 보완하고, LRL에서 더 유창하고 자연스럽게 만든다.
  • 영어 단일 언어 데이터와 HRL-영어 병렬 데이터를 모두 사용하여 데이터 증강을 수행함으로써 이중 소스 데이터 확장을 가능하게 한다.
  • 양방향 및 단방향 사전 유도 방법을 구현하여 단어 쌍 선택이 모델 성능에 미치는 영향을 평가한다.
  • 원본 LRL-영어 데이터와 증강된 LRL-영어 데이터를 함께 사용하여 공동 번역 모델을 훈련시켜 일반화 능력을 향상시킨다.
  • 극도의 저자원 조건에서 네 개의 저자원 언어 쌍에 걸쳐 프레임워크를 평가한다.

실험 결과

연구 질문

  • RQ1높이 자원 언어(HRL)를 통해 피벗화하면 저자원 기계 번역에서 데이터 증강에 도움이 될 수 있는가?
  • RQ2유도된 이중어사전을 사용한 단어별 대체는 HRL 데이터로부터 현실적인 LRL 문장을 생성하는 데 얼마나 효과적인가?
  • RQ3사전 대체된 문장에 무 supervision 기계 번역을 적용할 경우 생성된 LRL 데이터의 품질은 어느 정도 향상되는가?
  • RQ4영어 단일 언어 데이터와 HRL-영어 병렬 데이터로부터의 증강을 동시에 적용하면 표준 백번역보다 더 큰 성능 향상을 얻을 수 있는가?
  • RQ5단방향과 양방향 사전 유도 방법의 선택은 최종 번역 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 두 단계 피벗 방법은 극도의 저자원 환경에서 감독 기반 백번역 기준보다 번역 품질을 1.5에서 8 BLEU 포인트 향상시킨다.
  • 양방향 사전 유도 방법이 단방향 유도 방법보다 성능이 뛰어나며, 이는 비상호적 단어 쌍에 의한 노이즈 감소 때문일 것이다.
  • 영어 단일 언어 데이터와 HRL-영어 병렬 데이터로부터의 증강을 병행할 경우 단일 소스 증강보다 추가로 1.1 BLEU 포인트 향상된다.
  • 희귀어의 영향을 크게 줄이기 위해 LRL 어휘를 HRL 문장에 삽입함으로써 모델의 강건성을 향상시킨다.
  • 무 supervision 보완 단계(m-UMT)는 순수한 대체 결과에 비해 생성된 LRL 문장의 유창성과 자연스러움을 크게 향상시킨다.
  • 네 개의 서로 다른 저자원 언어 쌍에 걸쳐 일관된 성능 향상이 나타나, 이 프레임워크의 광범위한 적용 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.