[논문 리뷰] Kencorpus: A Kenyan Language Corpus of Swahili, Dholuo and Luhya for Natural Language Processing Tasks
Kencorpus는 케냐의 자생적 언어인 스와힐리어, 돌루오, 루야에 대해 공개된 다국어 어휘자료를 제공한다. 어휘자료에는 5,594건의 자료(560만 단어의 텍스트, 177시간의 음성)가 포함되어 있으며, 품사 태깅, 기계 번역, 질의응답 등 후행 NLP 작업을 가능하게 한다. 개념 증명 시스템은 음성-텍스트 변환에서 18.87%의 WER, 질의응답에서 80%의 EM을 기록하여 동아프리카의 저자원 언어 처리 분야에서 중요한 진전을 이룩했다.
Indigenous African languages are categorized as under-served in Natural Language Processing. They therefore experience poor digital inclusivity and information access. The processing challenge with such languages has been how to use machine learning and deep learning models without the requisite data. The Kencorpus project intends to bridge this gap by collecting and storing text and speech data that is good enough for data-driven solutions in applications such as machine translation, question answering and transcription in multilingual communities. The Kencorpus dataset is a text and speech corpus for three languages predominantly spoken in Kenya: Swahili, Dholuo and Luhya. Data collection was done by researchers from communities, schools, media, and publishers. The Kencorpus' dataset has a collection of 5,594 items - 4,442 texts (5.6M words) and 1,152 speech files (177hrs). Based on this data, Part of Speech tagging sets for Dholuo and Luhya (50,000 and 93,000 words respectively) were developed. We developed 7,537 Question-Answer pairs for Swahili and created a text translation set of 13,400 sentences from Dholuo and Luhya into Swahili. The datasets are useful for downstream machine learning tasks such as model training and translation. We also developed two proof of concept systems: for Kiswahili speech-to-text and machine learning system for Question Answering task, with results of 18.87% word error rate and 80% Exact Match (EM) respectively. These initial results give great promise to the usability of Kencorpus to the machine learning community. Kencorpus is one of few public domain corpora for these three low resource languages and forms a basis of learning and sharing experiences for similar works especially for low resource languages.
연구 동기 및 목표
- 케냐의 저자원 언어에 대한 디지털 소외 문제를 해결하기 위해, 공개 가능한 대규모 어휘자료를 구축함으로써 케냐 내 저자원 언어에 기여하고자 한다.
- 현지 학교, 미디어, 출판사, 지역 사회 구성원들로부터 고품질의 텍스트 및 음성 데이터를 수집하고 정제하여 데이터 기반 NLP 응용 프로그램을 지원하고자 한다.
- 스와힐리어, 돌루오, 루야 언어에 특화된 자원, 예를 들어 품사 태깅, 질의응답 쌍, 병렬 번역 세트를 개발하고자 한다.
- Kencorpus 어휘자료를 활용하여 저자원 아프리카 언어에 대한 NLP 모델을 훈련하고 평가할 수 있는 가능성을 입증하고자 한다.
- 특히 다국어 아프리카 환경을 고려한 저자원 언어 NLP 분야의 향후 연구 및 협업을 위한 기반을 마련하고자 한다.
제안 방법
- 어휘자료 수집은 지역 기반 협업을 통해 수행되었으며, 현지 학교, 미디어 기관, 출판사, 지역 사회 구성원들로부터 텍스트 및 음성 자료를 확보하였다.
- 어휘자료는 스와힐리어, 돌루오, 루야어로 구성되며, 텍스트 자료 4,442건(560만 단어), 음성 파일 1,152개(177시간의 음성)로 구성되어 있다.
- 전문가가 태깅한 학습 데이터를 사용하여 돌루오어(5만 단어), 루야어(93,000단어)의 품사 태깅을 개발하였다.
- 기존 텍스트 자료에서 7,537개의 스와힐리어 질의응답 쌍으로 구성된 질의응답 데이터셋을 구축하였다.
- 돌루오어 및 루야어에서 스와힐리어로 13,400개 문장의 병렬 번역 세트를 제작하였다.
- 개념 증명용 두 가지 시스템을 구현하였다: 음성 인식 기반 음성-텍스트 변환 시스템과 지도 학습 기반 질의응답 모델.
실험 결과
연구 질문
- RQ1스와힐리어, 돌루오, 루야와 같은 저자원 아프리카 언어를 대상으로 한 대규모, 지역 기반 어휘자료가 NLP 응용에 효과적으로 수집되고 정제될 수 있는가?
- RQ2Kencorpus 어휘자료가 품사 태깅, 기계 번역, 질의응답과 같은 후행 NLP 작업을 어느 정도 지원할 수 있는가?
- RQ3저자원 언어의 음성-텍스트 변환 및 질의응답 시스템에서 Kencorpus 어휘자료를 활용할 경우 기대할 수 있는 성능은 어떠한가?
- RQ4저자원 환경에서 지역 사회에서 확보한 데이터의 품질과 다양성은 전통적 데이터 수집 방법과 비교해 어떤가?
- RQ5Kencorpus 프레임워크는 다른 저자원 아프리카 언어에 대해 재현 가능할 수 있는가? 이를 통해 디지털 포용성을 향상시킬 수 있는가?
주요 결과
- Kencorpus 어휘자료는 총 5,594건의 자료를 포함하며, 텍스트 문서 4,442건(560만 단어), 음성 파일 1,152개(177시간의 음성)로 구성되어 있어 케냐의 주요 언어에 대해 중요한 자원을 제공한다.
- 돌루오어(5만 단어), 루야어(93,000단어)의 품사 태깅 세트가 성공적으로 개발되어 저자원 환경에서 문법적 분석이 가능해졌다.
- 7,537개의 스와힐리어 질의응답 쌍으로 구성된 질의응답 데이터셋이 구축되어 추출 기반 QA 모델의 학습을 지원한다.
- 돌루오어 및 루야어에서 스와힐리어로 13,400개 문장의 병렬 번역 세트가 제작되어 다국어 NLP 응용 프로그램을 촉진한다.
- 음성-텍스트 변환 시스템은 18.87%의 단어 오류율(WER)을 기록하여 이 언어들에 대한 자동 음성 인식의 가능성을 입증하였다.
- 질의응답 모델은 정확한 일치 점수(EM) 80%를 달성하여 Kencorpus 데이터를 활용한 추출 기반 QA 작업에서 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.