Skip to main content
QUICK REVIEW

[논문 리뷰] Contemporary Amharic Corpus: Automatically Morpho-Syntactically Tagged Amharic Corpus

Andargachew Mekonnen Gezmu, Binyam Ephrem Seyoum|arXiv (Cornell University)|2021. 06. 14.
Language, Linguistics, Cultural Analysis참고 문헌 10인용 수 13
한 줄 요약

이 논문은 25,199개의 다양한 문서에서 유래한 2,400만 개의 철자어를 포함하는 대규모 자동 형태구문 분석 태그가 부여된 아مهر라어 어휘자료인 현대 아مهر라어 어휘자료를 제시한다. 저자들은 자동 태깅을 위해 HornMorpho 형태분석기를 개선하고, 웹 기반 어휘자료의 데이터 품질을 향상시키기 위해 철자 오류 수정을 적용하여 아مهر라어 자연어 처리 연구를 위한 유용한 자원을 구축하였다.

ABSTRACT

We introduced the contemporary Amharic corpus, which is automatically tagged for morpho-syntactic information. Texts are collected from 25,199 documents from different domains and about 24 million orthographic words are tokenized. Since it is partly a web corpus, we made some automatic spelling error correction. We have also modified the existing morphological analyzer, HornMorpho, to use it for the automatic tagging.

연구 동기 및 목표

  • 저자원 언어인 아مهر라어를 위한 대규모 자동 태깅 형태구문 어휘자료를 구축하기 위해.
  • 다양한 도메인에서 수집한 텍스트 데이터를 수집하고 전처리하여 언어학적 대표성을 확보하기 위해.
  • 웹 기반 텍스트에 자동 철자 오류 보정을 적용하여 데이터 품질을 향상시키기 위해.
  • 기존 형태분석기인 HornMorpho를 아amaha어 텍스트의 정확한 자동 태깅을 위해 적응 및 확장하기 위해.
  • 자연어 처리 분야에서 아مهر라어를 지원하기 위해 공개 가능한 언어학적 자원을 제공하기 위해.

제안 방법

  • 다양한 도메인에서 25,199개의 문서에서 텍스트를 수집하여 다양성과 포괄성을 확보하였다.
  • 약 2,400만 단어를 처리하기 위해 철자어 토큰화를 적용하였다.
  • 노이즈가 많은 웹 기반 텍스트를 처리하기 위해 자동 철자 오류 보정을 구현하였다.
  • HornMorpho 형태분석기를 수정하여 아مهر라어의 자동 형태구문 태깅을 지원하도록 하였다.
  • 전처리된 어휘자료에 대해 향상된 HornMorpho 시스템을 사용하여 태깅을 수행하였다.
  • 최종 어휘자료는 자연어 처리 연구를 위한 언어학적 자원으로 공개되었다.

실험 결과

연구 질문

  • RQ1다양하고 웹 기반의 소스에서 대규모 형태구문 태깅이 부여된 아مهر라어 어휘자료를 어떻게 구축할 수 있는가?
  • RQ2저자원 언어에서 자동 철자 오류 보정을 통해 어휘자료 품질을 얼마나 향상시킬 수 있는가?
  • RQ3HornMorpho와 같은 기존 형태분석기가 아مهر라어의 자동 태깅에 얼마나 적합하게 적응될 수 있는가?
  • RQ4도메인 다양성이 생성된 어휘자료의 대표성과 유용성에 어떤 영향을 미치는가?
  • RQ5공개 가능한 자동 태깅 어휘자료가 아مهر라어의 후속 자연어 처리 작업에 어떤 영향을 미칠 수 있는가?

주요 결과

  • 어휘자료는 다양한 도메인에서 유래한 25,199개의 문서에서 약 2,400만 개의 철자어로 구성되어 있다.
  • 자동 철자 오류 보정이 웹 기반 텍스트 구성 요소의 품질을 크게 향상시켰다.
  • 수정된 HornMorpho 시스템이 어휘자료에 대해 자동 형태구문 태깅을 성공적으로 수행하였다.
  • 최종 어휘자료는 COLING 2018에서 열린 제1회 자연어 처리를 위한 언어학적 자원 워크숍에서 언어학적 자원으로 공개되었다.
  • 어휘자료는 아مهر라어 자연어 처리 시스템의 학습 및 평가를 위한 기초 자원으로 기능한다.
  • 기존 도구를 적응시켜 저자원 언어를 대상으로 대규모 자동 태깅 어휘자료를 구축하는 것이 가능하다는 점을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.