Skip to main content
QUICK REVIEW

[논문 리뷰] The first large scale collection of diverse Hausa language datasets

Isa Inuwa-Dutse|arXiv (Cornell University)|2021. 02. 13.
Natural Language Processing Techniques참고 문헌 10인용 수 7
한 줄 요약

이 논문은 뉴스 및 종교 웹사이트의 공식 텍스트와 소셜 미디어의 비공식적 콘텐츠를 결합하여, 처음으로 대규모이자 다양한 하우사어 자연어 처리(NLP) 데이터셋을 제안한다. 이 데이터셋은 뉴스, 블로그, 소셜 미디어 등 다양한 출처에서 유래한 광범위하고 다양하며 고품질의 훈련 데이터를 제공함으로써, 저자원 아프리카어인 하우사어에서 기계 번역, 감성 분석, 가짜 뉴스 탐지 등의 NLP 작업을 향상시킨다.

ABSTRACT

Hausa language belongs to the Afroasiatic phylum, and with more first-language speakers than any other sub-Saharan African language. With a majority of its speakers residing in the Northern and Southern areas of Nigeria and the Republic of Niger, respectively, it is estimated that over 100 million people speak the language. Hence, making it one of the most spoken Chadic language. While Hausa is considered well-studied and documented language among the sub-Saharan African languages, it is viewed as a low resource language from the perspective of natural language processing (NLP) due to limited resources to utilise in NLP-related tasks. This is common to most languages in Africa; thus, it is crucial to enrich such languages with resources that will support and speed the pace of conducting various downstream tasks to meet the demand of the modern society. While there exist useful datasets, notably from news sites and religious texts, more diversity is needed in the corpus. We provide an expansive collection of curated datasets consisting of both formal and informal forms of the language from refutable websites and online social media networks, respectively. The collection is large and more diverse than the existing corpora by providing the first and largest set of Hausa social media data posts to capture the peculiarities in the language. The collection also consists of a parallel dataset, which can be used for tasks such as machine translation with applications in areas such as the detection of spurious or inciteful online content. We describe the curation process -- from the collection, preprocessing and how to obtain the data -- and proffer some research problems that could be addressed using the data.

연구 동기 및 목표

  • NLP 연구를 위한 다양한 고품질의 하우사어 데이터셋 부족 문제를 해결하기 위해.
  • 공식(뉴스, 종교 텍스트)과 비공식(소셜 미디어) 언어 형태를 모두 포함하는 종합적이고 체계화된 코퍼스를 제공하기 위해.
  • 기계 번역, 감성 분석, 가짜 뉴스 탐지와 같은 하우사어의 후행 NLP 작업을 지원하기 위해. 하우사어는 저자원 아프리카어이다.
  • 향후 하우사어 NLP 자원 확장에 대비해 데이터 수집 및 전처리를 표준화하기 위해.
  • 온라인 자료에서 유래한 다양한 실제 언어 사용을 활용하여 하우사어 NLP 모델의 성능을 향상시키기 위해.

제안 방법

  • 데이터셋은 159개의 웹사이트 및 블로그와 페이스북, 트위터 등의 플랫폼에서 수집한 120만 개 이상의 소셜 미디어 게시물에서 유래하였다.
  • 텍스트는 노이즈 제거, 철자 정규화, 언어 양식(공식 대비 비공식)에 대한 주석 처리를 통해 전처리되었다.
  • 기계 번역 작업을 위해 평행 데이터셋이 구축되어 다국어 모델 훈련을 가능하게 하였다.
  • 코퍼스는 주제적·언어적 다양성을 확보하기 위해 '웹사이트 및 블로그'와 '소셜 스트림'으로 나누어 구성되었다.
  • 공개 API와 웹 스크래핑 기법을 활용하여 소셜 미디어 데이터를 수집하고 추출하는 체계적인 데이터 추출 파이프라인을 개발하였다.
  • 재현 가능성을 확보하기 위해 문서, 메타데이터, 접근 지침을 포함한 GitHub 레포지터리에서 데이터셋을 공개하였다.

실험 결과

연구 질문

  • RQ1어떻게 공식적이고 비공식적인 온라인 출처에서부터 다양한 대규모 하우사어 언어 데이터셋을 수집하고 체계화할 수 있는가?
  • RQ2소셜 미디어 데이터의 포함은 NLP 모델에서 현지어나 비공식 하우사어 언어 표현의 표현력을 얼마나 향상시킬 수 있는가?
  • RQ3제안된 코퍼스가 기계 번역 및 감성 분석과 같은 하우사어 후행 NLP 작업의 성능을 상당히 향상시킬 수 있는가?
  • RQ4아프리카어 중 하우사어와 같은 저자원 언어를 대상으로 대규모 데이터셋을 구축할 때의 주요 과제와 최선의 실천 방법은 무엇인가?
  • RQ5소셜 미디어에서 비롯된 비공식 언어의 포함은 하우사어에서 위험한 또는 오락적 성향의 온라인 콘텐츠 탐지에 어떻게 기여할 수 있는가?

주요 결과

  • 본 연구는 159개의 웹사이트 및 블로그에서 온 공식 텍스트와 120만 개 이상의 소셜 미디어 게시물을 포함하는, 하우사어 언어 데이터셋의 첫 번째 대규모 체계화된 컬렉션을 제시한다.
  • 기계 번역 시스템 훈련에 적합한 평행 코퍼스가 포함되어 있어, 하우사어 NLP 자원에서 큰 격차를 메우는 데 기여한다.
  • 비공식적인 소셜 미디어 콘텐츠의 포함은 전통적인 뉴스나 종교 코퍼스에선 발견되지 않는 현지어 표현과 언어적 다양성을 포착한다.
  • 초기 평가 결과, 기존의 번역 시스템인 구글 번역은 특히 비공식적이거나 관용어 표현에 대해 빈약한 성능을 보이며, 더 나은 훈련 데이터가 필요함을 시사한다.
  • 이 코퍼스를 통해 하우사어의 감성 분석, 명명된 실체 인식, 가짜 뉴스 탐지 등 더 견고한 NLP 도구의 개발이 가능해진다.
  • 이 데이터셋은 문서와 메타데이터가 상세히 기재된 GitHub에서 공개되어 있어 재현 가능하며, 향후 하우사어 NLP 연구의 확장에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.