Skip to main content
QUICK REVIEW

[논문 리뷰] Parallel Corpus Filtering via Pre-trained Language Models

Boliang Zhang, Ajay Nagesh|arXiv (Cornell University)|2020. 05. 13.
Natural Language Processing Techniques참고 문헌 28인용 수 7
한 줄 요약

이 논문은 수용성 필터링에 다국어 BERT를, 도메인 필터링에 GPT를 사용하는 새로운 병렬 코퍼스 필터링 방법을 제안하며, WMT 2018과 최근 공개된 일본어-중국어 웹 크롤링 코퍼스에서 기존 베이스라인을 크게 능가하여, 감독 학습 방법과 비교할 만한 비감독 설정에서도 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Web-crawled data provides a good source of parallel corpora for training machine translation models. It is automatically obtained, but extremely noisy, and recent work shows that neural machine translation systems are more sensitive to noise than traditional statistical machine translation methods. In this paper, we propose a novel approach to filter out noisy sentence pairs from web-crawled corpora via pre-trained language models. We measure sentence parallelism by leveraging the multilingual capability of BERT and use the Generative Pre-training (GPT) language model as a domain filter to balance data domains. We evaluate the proposed method on the WMT 2018 Parallel Corpus Filtering shared task, and on our own web-crawled Japanese-Chinese parallel corpus. Our method significantly outperforms baselines and achieves a new state-of-the-art. In an unsupervised setting, our method achieves comparable performance to the top-1 supervised method. We also evaluate on a web-crawled Japanese-Chinese parallel corpus that we make publicly available.

연구 동기 및 목표

  • 고품질 신경 기계 번역 시스템을 훈련하기 위해 노이즈가 많은 웹 크롤링 병렬 코퍼스를 필터링하는 과제를 해결하기 위해.
  • 청소된 병렬 데이터가 제한적이거나 전혀 없을 경우에도 효과적으로 작동하는 필터링 방법을 개발하여, 일본어-중국어와 같은 저자원 언어 쌍에 적용 가능하도록 하기 위해.
  • 다국어 BERT를 문장 쌍의 수용성에 대해, GPT를 도메인 관련성에 대해 사용하여 성능을 향상시키고, 대규모 청소된 병렬 코퍼스에 대한 의존도를 줄이기 위해.
  • 비영어 언어 쌍 번역 연구를 지원하기 위해, 대규모 공개 가능한 일본어-중국어 병렬 코퍼스를 공개하기 위해.

제안 방법

  • 30만 개의 고품질 소프트웨어 도메인 문장 쌍을 포함하는 합성 데이터셋에 다국어 BERT를 미세조정하여 유효성 필터를 생성한다. 이때 긍정 예시로 30만 개의 양호한 쌍을, 동일한 크기의 부정 예시 쌍을 사용한다.
  • BERT 분류기의 소프트맥스 출력을 점수로 사용하여 문장 쌍이 유효한 번역 쌍인지 여부를 결정한다.
  • 도메인 내 중국어 텍스트에 기반한 GPT 기반 언어 모델과 노이즈가 많은 데이터에 기반한 KenLM n-그램 모델을 훈련시켜, 언어적 자연스러움을 기반으로 문장 쌍의 점수를 매기는 도메인 필터를 구축한다.
  • 수용성 점수와 도메인 점수를 조합하여 문장 쌍을 순위 매기고, 개발 세트 성능에 따라 훈련을 위한 상위-N 쌍을 선택한다.
  • BERT 분류기의 확률 출력에 임계값(예: 0.9)을 적용하여 정밀도와 재현도의 균형을 맞춘다.
  • 감독 학습 및 비감독 학습 설정을 모두 사용하여 강력한 베이스라인인 이중 조건부 교차 엔트로피 필터링 및 마진 기반 점수 계산과의 복제 및 비교를 수행한다.

실험 결과

연구 질문

  • RQ1합성 데이터셋에 의해 미세조정된 다국어 BERT 기반 분류기가 노이즈가 많은 웹 크롤링 병렬 코퍼스에서 유효한 병렬 문장 쌍을 효과적으로 식별할 수 있는가?
  • RQ2GPT 기반 도메인 필터를 통합함으로써, 대규모 노이즈가 많은 병렬 데이터에서 신경 기계 번역 모델을 훈련시킬 때 성능 향상이 이루어지는가?
  • RQ3비감독 필터링 방법이 수백만 개의 청소된 병렬 문장 쌍을 사용하는 감독 학습 방법과 비교해도 성능이 유사한가?
  • RQ4정밀도, 재현도, 그리고 후속 NMT BLEU 점수 측면에서 기존 필터링 기법과 비교해 본다면, 제안된 방법은 어떻게 성능을 내는가?

주요 결과

  • 제안된 방법은 WMT 2018 독일어-영어 병렬 코퍼스 필터링 공모전에서 새로운 최신 기술 수준의 성능을 달성하며, 강력한 베이스라인을 능가한다.
  • BERT 분류기의 임계값을 0.9로 설정했을 때, 수작업으로 검토한 일본어-중국어 테스트 세트에서 정밀도 97.7%와 재현도 66.9%를 기록한다.
  • 비감독 설정에서 제안된 방법은 수백만 개의 청소된 병렬 문장 쌍을 사용하는 최상위 감독 학습 방법과 비교해 유사한 성능을 달성한다.
  • GPT 기반 도메인 필터는 모델이 자체적으로 데이터 크기를 선택할 수 있는 조건에서는 NMT 성능 향상에 기여하지 않으며, 이는 잘못된 문장이지만 병렬인 경우가 해로운 일도, 도움이 되는 일도 아니라는 것을 시사한다.
  • WMT 2018 및 내부에서 확보한 일본어-중국어 필터링 작업 모두에서, 적합성(이중 조건부 교차 엔트로피) 및 Chaudhary 등(2019)의 방법과 같은 기존 접근법보다 뚜렷이 뛰어난 성능을 보인다.
  • 저자들은 대규모 공개 가능한 웹 크롤링 일본어-중국어 병렬 코퍼스를 공개하였으며, 향후 비영어 언어 쌍 번역 연구에 기여할 것으로 기대된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.