[논문 리뷰] scb-mt-en-th-2020: A Large English-Thai Parallel Corpus
이 논문은 뉴스, 위키백과, 문자메시지, 정부 문서, 웹 크롤링 데이터 등 다양한 출처에서 수집한 100만 개 이상의 문장 쌍을 포함한 대규모 영어-태국어 병렬 코퍼스인 scb-mt-en-th-2020을 소개한다. 유니버설 문장 인코더를 활용한 필터링을 통해 트랜스포머 기반 모델을 훈련시켜 태국어→영어 번역에서 Google 번역과 동등한 성능을 달성했으며, OPUS 데이터와 조합할 경우 더 뛰어난 성능을 보이며 IWSLT 2015 벤치마크에서 최신 기술 수준을 확보했다.
The primary objective of our work is to build a large-scale English-Thai dataset for machine translation. We construct an English-Thai machine translation dataset with over 1 million segment pairs, curated from various sources, namely news, Wikipedia articles, SMS messages, task-based dialogs, web-crawled data and government documents. Methodology for gathering data, building parallel texts and removing noisy sentence pairs are presented in a reproducible manner. We train machine translation models based on this dataset. Our models' performance are comparable to that of Google Translation API (as of May 2020) for Thai-English and outperform Google when the Open Parallel Corpus (OPUS) is included in the training data for both Thai-English and English-Thai translation. The dataset, pre-trained models, and source code to reproduce our work are available for public use.
연구 동기 및 목표
- 저자원 기계 번역을 위한 고품질이고 다양한 영어-태국어 병렬 데이터의 부족 문제를 해결하기 위해.
- 이질적인 자료원에서부터 대규모 영어-태국어 문장 쌍을 수집, 정렬, 필터링하는 재현 가능한 방법론을 개발하기 위해.
- 새로운 코퍼스를 기반으로 트랜스포머 기반 기계 번역 모델을 훈련하고 평가하며, Google 번역과 같은 상용 API와의 성능을 비교하기 위해.
- 연구의 재현 가능성을 높이고 태국어 NLP 분야의 향후 연구를 지원하기 위해 데이터셋, 미리 훈련된 모델, 소스 코드를 공개하기 위해.
- 도메인 다양성이 저자원 번역 환경에서 모델 일반화 능력에 미치는 영향을 탐구하기 위해.
제안 방법
- 뉴스, 위키백과, 문자메시지, 작업 기반 대화, 웹 크롤링 콘텐츠, 정부 문서 등 6개 출처에서 1,001,752개의 영어-태국어 문장 쌍을 수집했다.
- 공식적인 태국어 문장 구분 기호가 없기 때문에 문장 경계를 영어 문장 경계로 사용하였으며, 모호한 경우를 단일 세그먼트로 간주했다.
- 유니버설 문장 인코더 임베딩과 코사인 유사도를 활용해 잘못 정렬되거나 품질이 낮은 세그먼트 쌍을 필터링했다.
- 중복 제거, 정규화, 유사도 임계값 기반 필터링을 포함한 다단계 전처리 파이프라인을 적용하여 데이터 품질을 확보했다.
- scb-mt-en-th-2020 및 OPUS 데이터셋에서 서브워드 수준과 워드 수준 토크나이저를 사용해 트랜스포머 기반의 시퀀스-투-시퀀스 모델을 훈련시켰다.
- IWSLT 2015 및 OPUS, scb-mt-en-th-2020 테스트 세트에서 SacreBLEU(대소문자 구분)와 BLEU4를 사용해 모델 성능을 평가했다.
실험 결과
연구 질문
- RQ1이질적이고 저자원 데이터 출처에서부터 대규모로, 다양하고 고품질의 영어-태국어 병렬 코퍼스를 어떻게 구성할 수 있는가?
- RQ2훈련 데이터의 도메인 다양성이 영어-태국어 및 태국어-영어 기계 번역 모델의 성능에 어느 정도 영향을 미치는가?
- RQ3사용자 정의로 수집한 코퍼스가 Google 번역과 같은 상용 번역 API를 초월하거나 이를 대체할 수 있는가?
- RQ4유니버설 문장 인코더는 저자원 병렬 데이터에서 노이즈가 많거나 잘못 정렬된 문장 쌍을 얼마나 효과적으로 필터링하는가?
- RQ5종합적인 번역 작업에서 OPUS와 같은 기존 데이터셋과 제안된 코퍼스를 조합했을 때 성능 향상은 어느 정도 이루어지는가?
주요 결과
- scb-mt-en-th-2020 코퍼스는 뉴스, 정부 문서, 문자메시지, 구어 대화 등 다양한 도메인을 포함해 총 1,001,752개의 고품질 영어-태국어 문장 쌍을 포함한다.
- scb-mt-en-th-2020 코퍼스만으로 훈련된 모델은 태국어→영어 IWSLT 2015 벤치마크에서 2020년 5월 기준 Google 번역 API와 유사한 성능을 달성했다.
- OPUS와 scb-mt-en-th-2020 코퍼스를 모두 사용한 훈련 데이터로 모델을 훈련시켰을 경우, Google 번역을 초월하여 태국어→영어 번역에서 0.24 BLEU 포인트 향상, 영어→태국어 번역에서 0.53 BLEU 포인트 향상이 이루어졌다.
- 도메인별 성능은 크게 다를 수 있었으며, 테스트 세트와 동일한 도메인에서 훈련된 모델(예: SCB_1M on SCB_1M)은 다른 도메인에서 훈련된 모델(예: SCB_1M on OPUS)보다 BLEU 점수를 4~8배 높게 기록했다.
- 유니버설 문장 인코더 필터링 방법은 노이즈가 많은 쌍을 효과적으로 줄였지만, 번역 결과의 적합성 오류는 완전히 제거하지 못했다.
- 데이터셋, 미리 훈련된 모델, 소스 코드의 공개는 재현 가능한 연구를 가능하게 하며, 특히 저자원 기계 번역 분야에서 태국어 NLP의 발전을 이끌고 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.