Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Parallel Corpus Mining on Web Data

Guokun Lai, Zihang Dai|arXiv (Cornell University)|2020. 09. 18.
Natural Language Processing Techniques참고 문헌 12인용 수 4
한 줄 요약

이 논문은 레이블이 부여된 병렬 데이터가 없이도 비지도 학습 기계 번역기를 활용해 가짜 병렬 데이터를 생성하고, 이를 통해 웹 크롤링에서 고품질의 병렬 문장을 필터링하는 분류기 학습을 위한 비지도 학습 웹 병렬 코퍼스 마이닝 파이프라인을 제안한다. 이 방법은 저자원 언어 쌍에서 최신 기술 수준의 성능을 달성하며(En-Ro에서 39.81 BLEU, Ro-En에서 38.95 BLEU), WMT 벤치마크에서 지도 학습 시스템과 동등하거나 이를 초월한다.

ABSTRACT

With a large amount of parallel data, neural machine translation systems are able to deliver human-level performance for sentence-level translation. However, it is costly to label a large amount of parallel data by humans. In contrast, there is a large-scale of parallel corpus created by humans on the Internet. The major difficulty to utilize them is how to filter them out from the noise website environments. Current parallel data mining methods all require labeled parallel data as the training source. In this paper, we present a pipeline to mine the parallel corpus from the Internet in an unsupervised manner. On the widely used WMT'14 English-French and WMT'16 English-German benchmarks, the machine translator trained with the data extracted by our pipeline achieves very close performance to the supervised results. On the WMT'16 English-Romanian and Romanian-English benchmarks, our system produces new state-of-the-art results, 39.81 and 38.95 BLEU scores, even compared with supervised approaches.

연구 동기 및 목표

  • 신경 기계 번역 시스템을 훈련하기 위해 인간이 애너테이션한 병렬 코퍼스의 높은 비용과 부족함을 해결하기 위해.
  • 레이블이 부여된 병렬 데이터가 전혀 필요 없이 웹에서 대규모로 저비용으로 병렬 코퍼스를 마이닝할 수 있도록 하기 위해.
  • 비지도 마이닝을 통해 저자원 언어 쌍에서 신경 기계 번역 모델의 성능을 향상시키기 위해.
  • 레이블이 없는 병렬 데이터가 존재하는 모든 언어 쌍에 적용 가능한 확장 가능한 파이프라인을 개발하기 위해.

제안 방법

  • 데노이징 오토인코더와 백트랜슬레이션을 포함한 XLM 스타일의 목표를 사용해 비지도 기계 번역 모델을 훈련한다.
  • 비지도 번역기가 생성한 가짜 병렬 데이터에서 시드 사전을 생성하여 웹 크롤링을 안내한다.
  • 문서 및 문장 정렬 기능을 갖춘 Bitextor 크롤러를 사용해 다국어 웹사이트에서 원시 병렬 문장 쌍을 추출한다.
  • 가짜 병렬 데이터에 기반해 훈련된 분류기를 적용하여 크롤링된 코퍼스에서 저품질 및 노이즈가 많은 문장 쌍을 필터링한다.
  • 최종적으로 필터링된 코퍼스를 지도 학습 데이터로 사용해 신경 기계 번역 모델을 미세 조정한다.
  • 성능 평가를 위해 파이프라인을 비지도 학습 목표와 통합하여 저자원 환경에서의 성능을 평가한다.

실험 결과

연구 질문

  • RQ1레이블이 없는 데이터가 전혀 없이도 비지도 기계 번역 시스템을 활용해 고품질의 병렬 코퍼스를 웹에서 부트스트랩할 수 있는가?
  • RQ2제안된 파이프라인이 지도 학습 방법에 비해 사용 가능한 병렬 데이터를 얼마나 효과적으로 추출하는가?
  • RQ3마이닝된 병렬 데이터가 저자원 언어 쌍에서 완전히 지도 학습 시스템과 동등하거나 이를 초월하는 성능을 달성할 수 있는가?
  • RQ4필터링 단계가 모델 성능에 어떤 영향을 미치며, 노이즈가 많은 데이터에 대해 훈련은 얼마나 강건한가?

주요 결과

  • 제안된 파이프라인은 WMT’16 영어-루마니아어 번역 벤치마크에서 39.81 BLEU를 달성하여 새로운 최신 기술 수준 성능을 기록했다.
  • 루마니아어-영어 번역에서 시스템은 38.95 BLEU를 기록했으며, 동일한 벤치마크에서 가장 뛰어난 지도 학습 결과(38.5 BLEU)를 초월했다.
  • WMT’14 영어-프랑스어 및 WMT’16 영어-독일어 벤치마크에서, 마이닝된 데이터로 훈련된 모델은 완전히 지도 학습된 시스템과 매우 유사한 성능을 보였다.
  • 절단 실험 결과, 원시 크롤링 데이터는 필터링된 데이터와 거의 동일한 성능를 보였지만, 저품질 데이터는 성능을 심각하게 떨어뜨리는 것으로 나타나, 분류기의 효과성을 확인했다.
  • 레이블이 필요한 데이터 의존도를 줄이고, 저자원 환경에서도 고품질 병렬 코퍼스 마이닝이 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.