Skip to main content
QUICK REVIEW

[논문 리뷰] JParaCrawl v3.0: A Large-scale English-Japanese Parallel Corpus

Makoto Morishita, Katsuki Chousa|arXiv (Cornell University)|2022. 02. 25.
Natural Language Processing Techniques인용 수 10
한 줄 요약

이 논문은 PDF 및 워드 문서를 포함한 최신 기술을 활용해 웹을 재크롤링한 대규모 영어-일본어 병렬 코퍼스인 JParaCrawl v3.0을 소개한다. 이 코퍼스는 2,100만 개 이상의 고유 문장 쌍을 포함하며, 다양한 도메인에서 신경 기반 기계 번역 성능을 크게 향상시킨다. 특히 코로나19와 같은 최근 주제에서 이전 버전을 뛰어넘는 성능을 보인다.

ABSTRACT

Most current machine translation models are mainly trained with parallel corpora, and their translation accuracy largely depends on the quality and quantity of the corpora. Although there are billions of parallel sentences for a few language pairs, effectively dealing with most language pairs is difficult due to a lack of publicly available parallel corpora. This paper creates a large parallel corpus for English-Japanese, a language pair for which only limited resources are available, compared to such resource-rich languages as English-German. It introduces a new web-based English-Japanese parallel corpus named JParaCrawl v3.0. Our new corpus contains more than 21 million unique parallel sentence pairs, which is more than twice as many as the previous JParaCrawl v2.0 corpus. Through experiments, we empirically show how our new corpus boosts the accuracy of machine translation models on various domains. The JParaCrawl v3.0 corpus will eventually be publicly available online for research purposes.

연구 동기 및 목표

  • 번역 모델 성능을 제한하는 대규모 공개 영어-일본어 병렬 코퍼스의 부족 문제를 해결하기 위해.
  • 최신 웹 크롤링 콘텐츠로 훈련 데이터를 확장하여 자원이 적은 언어 쌍의 기계 번역 품질을 향상시키기 위해.
  • 이전 JParaCrawl 코퍼스를 향상된 데이터 수집 및 필터링 기법을 통해 업데이트하고 확장하기 위해.
  • 새로운 코퍼스가 다양한 도메인과 테스트 세트에서 번역 정확도에 미치는 영향을 경험적으로 검증하기 위해.
  • 미래의 영어-일본어 기계 번역 연구 및 개발을 지원하기 위해 JParaCrawl v3.0을 공개하기 위해.

제안 방법

  • 공통 크롤링 아카이브를 재크롤링하여, HTML 페이지를 초월해 PDF 및 워드 문서를 포함한 다국어 웹 콘텐츠를 수집하였다.
  • 다국어 문장 임베딩 기반 정렬 기법을 적용해 다국어 간 병렬 문장 쌍을 식별하였다.
  • 노이즈가 많거나 품질이 낮거나 병렬이 아닌 문장 쌍을 제거하기 위한 필터링 파이프라인을 구현하였다.
  • 32,000 어휘 크기의 서브워드 모델을 사용한 sentencepiece 토크나이저를 적용해 훈련 데이터를 준비하였다.
  • fairseq 툴킷을 사용해 소형, 기본형, 대형 설정을 가진 Transformer 기반 신경 기계 번역 모델을 훈련시켰다.
  • 일致성을 확보하기 위해 NFKC 정규화를 적용한 sacreBLEU를 사용해 WMT, IWSLT, ASPEC, JESC 및 비즈니스 대화 테스트 세트에서 모델을 평가하였다.

실험 결과

연구 질문

  • RQ1더 크고 최신 기술 기반의 병렬 코퍼스는 다양한 도메인에서 영어-일본어 및 일본어-영어 신경 기반 기계 번역 성능을 크게 향상시키는가?
  • RQ2JParaCrawl v3.0은 이전 버전과 도메인 특화 훈련 데이터와 비교해 BLEU 점수 향상에서 어떻게 다른가?
  • RQ3최근에 등장한 용어, 예를 들어 코로나19 관련 용어의 번역 품질 향상에 새 코퍼스가 어느 정도 기여하는가?
  • RQ4뉴스, 자막, 과학 논문, 대화와 같은 자원이 적은 도메인에서 코퍼스가 성능 향상에 기여하는가?
  • RQ5PDF, 워드 등 HTML 이외의 형식이 최종 코퍼스의 크기와 품질에 의미 있는 기여를 하는가?

주요 결과

  • JParaCrawl v3.0 코퍼스는 21,481,513개의 고유 문장 쌍을 포함하며, 이는 이전 v2.0 버전보다 두 배 이상 크다.
  • JParaCrawl v3.0로 훈련된 모델은 15개의 영어-일본어 테스트 세트 중 13개와 모든 일본어-영어 테스트 세트에서 최고의 BLEU 점수를 기록했다.
  • v3.0 모델은 WMT2021 뉴스 번역 과제에서 특히 향상된 성능을 보였으며, 이는 이전 코퍼스에 잘 반영되지 않은 최근 용어인 'COVID-19'가 포함되었기 때문일 것이다.
  • WMT2021 테스트 세트의 번역 예시에서 v3.0은 '농축접촉자'를 'close contacts'로 정확히 번역했지만, v1.0과 v2.0은 이를 'strong contact person'으로 잘못 번역했다.
  • 과학 논문, 자막, 뉴스, 대화 등 여러 도메인에서 일관된 향상이 확인되어 코퍼스의 광범위한 적용 가능성을 입증했다.
  • 저자들은 새 코퍼스가 현대적 언어 사용을 특히 잘 포착함으로써 정기적인 코퍼스 업데이트의 필요성을 뒷받침함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.