[논문 리뷰] Towards a parallel corpus of Portuguese and the Bantu language Emakhuwa of Mozambique
이 논문은 모잠비크에서 사용되는 저자원 Bantu 어족인 에마쿠아와 포르투갈어의 47,415개 문장 쌍으로 구성된 평행 코퍼스를 구축한 바를 제시한다. 이 코퍼스는 종교, 법적, 교육적 자료에서 유래되었으며, 에마쿠아어 단어 토큰 699,976개와 포르투갈어 단어 토큰 877,595개를 포함한다. 연구용으로 정규화된 이 코퍼스는 포르투갈어에서 에마쿠아어로의 번역에서 12.42 BLEU 점수를 기록하는 기준 신경 번역 모델을 포함하고 있다.
Major advancement in the performance of machine translation models has been made possible in part thanks to the availability of large-scale parallel corpora. But for most languages in the world, the existence of such corpora is rare. Emakhuwa, a language spoken in Mozambique, is like most African languages low-resource in NLP terms. It lacks both computational and linguistic resources and, to the best of our knowledge, few parallel corpora including Emakhuwa already exist. In this paper we describe the creation of the Emakhuwa-Portuguese parallel corpus, which is a collection of texts from the Jehovah's Witness website and a variety of other sources including the African Story Book website, the Universal Declaration of Human Rights and Mozambican legal documents. The dataset contains 47,415 sentence pairs, amounting to 699,976 word tokens of Emakhuwa and 877,595 word tokens in Portuguese. After normalization processes which remain to be completed, the corpus will be made freely available for research use.
연구 동기 및 목표
- 저자원 아프리카어를 위한 평행 코퍼스 부족 문제를 해결하기 위해 포르투갈어와 에마쿠아어를 대상으로 대규모 다국어 데이터셋을 구축한다.
- 에마쿠아어의 경우 계산 및 언어학적 자원이 제한되어 있으므로, 이에 대한 신경 기계 번역(NMT) 시스템 개발을 지원한다.
- 종교, 법적, 교육 자료를 포함한 다양한 텍스트 자료를 수집하고 정규화하여 아프리카어 NLP의 접근성과 연구 잠재력을 향상시킨다.
- 다양한 도메인과 향상된 언어 정규화를 통해 향후 코퍼스 확장 기반을 마련한다.
- 재현 가능 연구와 모델 벤치마킹을 지원하기 위해 공개 가능하고 표준화된 데이터셋을 제공한다.
제안 방법
- 예수의 증인 웹사이트(JW), 아프리카 스토리 북(ASB), 프란시스코 바오로 6세 교육센터(CCA), 인권 선언(UR), 모잠비크 땅법(LL) 등 다양한 출처에서 평행 텍스트를 수집하였다.
- 스캔된 문서에 대해 OCR 처리를 수행한 후, 'ì'가 'T'로 잘못 인식되거나 'á'가 '6'으로 잘못 인식되는 등의 일반적인 OCR 오류를 수동으로 수정하였다.
- 문장 수준의 분할 및 필터링을 수행하여 잘못 인식되거나 손상된 문장을 제거하였다.
- 정확한 평행 문장 쌍을 확보하기 위해 포르투갈어와 에마쿠아어 문장을 수동으로 정렬하였다.
- 표기 불일치 문제를 해결하기 위해 'j'와 'c'의 사용 차이, 동사 형태에서의 'erya'와 'jerya'의 차이, 그리고 'bible'에 대한 'biblia'와 'biibiliya'의 표기 차이를 정규화하였다.
- OpenNMT-py를 사용하여 2층 LSTM 인코더와 디코더(500개의 은닉 유닛)를 갖춘 기준 NMT 모델을 구축하였으며, 데이터의 90:10 무작위 분할을 기반으로 훈련하였다.
실험 결과
연구 질문
- RQ1저자원 아프리카어인 에마쿠아어를 위한 대규모 고품질 평행 코퍼스는 어떻게 구축할 수 있는가?
- RQ2특히 철자 변형과 OCR 오류 문제를 고려할 때, 에마쿠아어 평행 텍스트 수집 및 정규화 과정에서의 주요 과제는 무엇인가?
- RQ3최근 제작된 에마쿠아어-포르투갈어 평행 코퍼스에서 표준 NMT 아키텍처를 사용할 경우 기대할 수 있는 기준 성능는 무엇인가?
- RQ4종교, 법적, 교육 자료와 같은 다양한 텍스트 자료는 어떻게 하나의 사용 가능한 평행 코퍼스로 통합될 수 있는가?
- RQ5커뮤니티 기반의 이니셔티브와 오픈 데이터 공유가 저자원 아프리카어 NLP 발전에 어떤 역할을 할 수 있는가?
주요 결과
- 최종 코퍼스는 47,415개의 문장 쌍으로 구성되며, 에마쿠아어어에는 699,976개의 단어 토큰, 포르투갈어에는 877,595개의 단어 토큰이 포함되어 있다.
- 이 데이터셋은 종교 텍스트(JW, CCA), 교육 자료(ASB), 법적 문서(LL), 인권 선언(HR)을 포함한 5개의 다른 출처에서 유래한 125개의 문서 쌍에서 유래되었다.
- 기준 NMT 모델은 포르투갈어에서 에마쿠아어로의 번역에서 BLEU 점수 12.42를 기록하였고, 에마쿠아어에서 포르투갈어로의 번역에서는 13.09의 BLEU 점수를 기록하였다.
- 중요한 철자 불일치 사례가 확인되었으며, 예를 들어 동사 형태에서 'cerya'와 'jerya'의 차이, 그리고 'bible'에 대한 'biblia'와 'biibiliya'의 표기 차이 등이 있었다. 향후 정규화가 필요하다.
- OCR 오류로 인해 'ì'가 'T'로 잘못 인식되고 'á'가 '6'으로 잘못 인식되는 등의 문제가 발생했으며, 사전 처리 단계에서 수동 수정이 필요했다.
- 코퍼스는 정규화가 완료된 후 공개될 예정이며, 향후 추가 자료 출처와 도메인 다양성을 활용한 확장 계획이 수립되어 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.