Skip to main content
QUICK REVIEW

[논문 리뷰] Developing a Fine-Grained Corpus for a Less-resourced Language: the case of Kurdish

Roshna Omer Abdulrahman, Hossein Hassani|arXiv (Cornell University)|2019. 09. 25.
Natural Language Processing Techniques참고 문헌 13인용 수 8
한 줄 요약

이 논문은 이라크 쿠르드스탄 주에서 사용되는 K-12 교과서 31권을 포함하는 도메인 특화 코퍼스인 KTC를 소개한다. 이 코퍼스는 정규화되고 12개의 교육 과목으로 분류되어 있으며, 총 693,800개의 토큰과 110,297개의 유형을 포함하고 있으며, CC BY-NC-SA 4.0 라이선스 하에 공개되어 있어 저자원 언어 환경에서 언어 모델링 및 문법 오류 수정과 같은 NLP 작업을 지원한다.

ABSTRACT

Kurdish is a less-resourced language consisting of different dialects written in various scripts. Approximately 30 million people in different countries speak the language. The lack of corpora is one of the main obstacles in Kurdish language processing. In this paper, we present KTC-the Kurdish Textbooks Corpus, which is composed of 31 K-12 textbooks in Sorani dialect. The corpus is normalized and categorized into 12 educational subjects containing 693,800 tokens (110,297 types). Our resource is publicly available for non-commercial use under the CC BY-NC-SA 4.0 license.

연구 동기 및 목표

  • 쿠르드어의 저자원 언어이자 다양한 방언과 스크립트를 가진 언어인 소라니 쿠르드어에 대해 도메인 특화 및 주석 처리된 코퍼스가 부족한 문제를 해결하기 위해.
  • 공식 K-12 교과서에서 고품질, 정규화, 과목별 분류된 코퍼스를 구축하여 NLP 개발을 지원하기 위해.
  • 과학적 및 교육적 글쓰기 분야에서 언어 모델링, 철자 검사, 문법 오류 수정과 같은 작업을 위한 신뢰할 수 있는 자원을 제공하기 위해.
  • 비-유니코드 인코딩과 일관되지 않은 철자 체계로 인해 쿠르드어 텍스트의 디지털화 및 정규화 과정에서 발생하는 과제를 극복하기 위해.
  • 특히 쿠르만지어와 같은 다른 쿠르드어 방언을 위한 향후 코퍼스 구축의 기반을 마련하기 위해.

제안 방법

  • 이라크 쿠르드스탄 주 교육부로부터 마이크로소프트 워드 및 애드오비 인디자인 형식으로 31권의 K-12 교과서를 확보하였다.
  • 비-유니코드 텍스트를 유니코드로 변환하고 공식 지역 철자 기준을 사용하여 수동으로 철자 일관성을 교정하였다.
  • 후속 NLP 작업을 위해 텍스트 무결성을 유지하기 위해 문장 부호 및 특수 문자를 그대로 유지하였다.
  • 각 교과서를 과목과 교육 수준별로 분류하여 총 12개의 고유한 교육 도메인을 도출하였다.
  • 철자 및 인코딩 과제로 인해 상당한 인간 감시가 필요한 반자동 처리 파이프라인을 적용하였다.
  • GitHub 를 통해 CC BY-NC-SA 4.0 라이선스 하에 비상업적 연구 목적을 위해 코퍼스를 공개하였다.

실험 결과

연구 질문

  • RQ1저자원 쿠르드어 방언인 소라니 쿠르드어를 위한 고품질 도메인 특화 코퍼스는 어떻게 구축할 수 있는가?
  • RQ2비표준 인코딩과 철자 체계를 가진 쿠르드어 교과서의 디지털화 및 정규화 과정에서 발생하는 과제는 무엇인가?
  • RQ3KTC 코퍼스는 언어 모델링 및 문법 오류 수정과 같은 NLP 작업에서 어느 정도 지원할 수 있는가?
  • RQ4정교하게 선별하고 전문가가 편집한 교과서 코퍼스는 쿠르드어에서 NLP 시스템의 학습 및 평가를 위한 신뢰할 수 있는 자원이 될 수 있는가?
  • RQ5다양한 교육 과목 간에 코퍼스의 언어적 및 구조적 다양성은 어떠한가?

주요 결과

  • KTC 코퍼스는 12개의 교육 과목에서 31권의 교과서를 통해 총 693,800개의 토큰과 110,297개의 고유한 단어 유형을 포함하고 있다.
  • 코퍼스는 K-12 학년을 아우르며, 물리학(111,032개 토큰), 신학(115,349개 토큰), 쿠르드어 어학 교육(153,334개 토큰) 등의 과목을 포함하고 있다.
  • 빈도가 높은 토큰으로서 'in'(لە), 'and'(و), 'to'(بۆ)와 같은 기능어가 포함되어 있으며, 단어 빈도 분포에서 지프의 법칙과 일치한다.
  • 코퍼스는 문장 부호 및 특수 문자를 그대로 유지하여 텍스트 무결성이 요구되는 작업에서의 유용성을 높였다.
  • 공식 지역 표준을 사용한 정규화 과정이 철자 일관성 문제를 성공적으로 해결하여 텍스트 품질을 향상시켰다.
  • 코퍼스는 https://github.com/KurdishBLARK/KTC 에서 CC BY-NC-SA 4.0 라이선스 하에 공개되어 있어 비상업적 연구 사용이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.