Skip to main content
QUICK REVIEW

[논문 리뷰] A Nepali Rule Based Stemmer and its performance on different NLP applications

Pravesh Koirala, Aman Shakya|arXiv (Cornell University)|2020. 02. 23.
Natural Language Processing Techniques참고 문헌 1인용 수 9
한 줄 요약

이 논문은 형태소 정규화, 예외 단어 처리 및 단어 변환을 사용하여 두 유형의 접미사와 단일 부정 접두사(Na)를 제거하는 규칙 기반 니파리 스테머를 제시한다. tf-idf 기반 정보 검색 및 나이브 베이즈 주제 분류에 대한 내재적(Paice의 방법) 및 외재적 테스트를 통해 평가되었으며, 스테머는 성능을 크게 향상시켜 니파리 NLP 응용 분야에서의 효과성을 입증한다.

ABSTRACT

Stemming is an integral part of Natural Language Processing (NLP). It's a preprocessing step in almost every NLP application. Arguably, the most important usage of stemming is in Information Retrieval (IR). While there are lots of work done on stemming in languages like English, Nepali stemming has only a few works. This study focuses on creating a Rule Based stemmer for Nepali text. Specifically, it is an affix stripping system that identifies two different class of suffixes in Nepali grammar and strips them separately. Only a single negativity prefix (Na) is identified and stripped. This study focuses on a number of techniques like exception word identification, morphological normalization and word transformation to increase stemming performance. The stemmer is tested intrinsically using Paice's method and extrinsically on a basic tf-idf based IR system and an elementary news topic classifier using Multinomial Naive Bayes Classifier. The difference in performance of these systems with and without using the stemmer is analysed.

연구 동기 및 목표

  • 니파리어에 특화된 규칙 기반 스테머를 개발하기 위해, 이는 자원이 적고 이전의 스테밍 작업이 제한적인 저자원 언어이다.
  • 접미사 제거 및 형태소 정규화에 초점을 맞춰 니파리 NLP를 위한 효과적인 사전 처리 도구의 부족을 해결하기 위해.
  • 예외 단어 식별 및 단어 변환 기법을 통해 스테밍 정확도를 향상시키기 위해.
  • 정보 검색 및 텍스트 분류와 같은 실제 NLP 작업에서 스테머의 영향을 평가하기 위해.
  • 다양한 NLP 응용 분야에서 시스템 성능 향상에 기여하는 스테머의 실용적 유용성을 입증하기 위해.

제안 방법

  • 스테머는 니파리 문법에서 두 가지 다른 유형의 접미사를 대상으로 하는 접두사 제거 메커니즘을 사용한다.
  • 형태소 일관성을 향상시키기 위해 단일 부정 접두사 'Na'를 식별하고 제거한다.
  • 과다 제거를 방지하고 어휘의 무결성을 유지하기 위해 예외 단어는 수동으로 수집하여 별도로 처리한다.
  • 일致성을 향상시키기 위해 스테밍 이전에 단어 형태를 표준화하기 위해 형태소 정규화를 적용한다.
  • 니파리 어휘의 비표준 또는 비정상적인 파생형을 처리하기 위해 단어 변환 규칙을 사용한다.
  • 시스템은 Paice의 내재적 방법과 tf-idf 기반 정보 검색 시스템 및 다항분포 나이브 베이즈 주제 분류기에서의 외재적 평가를 통해 평가된다.

실험 결과

연구 질문

  • RQ1제안된 규칙 기반 스테머는 니파리 어형을 근어로 줄이는 데 얼마나 효과적인가?
  • RQ2tf-idf 기반 정보 검색 시스템에서 스테머는 성능을 얼마나 향상시키는가?
  • RQ3다항분포 나이브 베이즈 텍스트 분류기에서 스테머는 정확도를 향상시키는가?
  • RQ4형태소 정규화와 예외 단어 처리 방식은 전체 스테밍 품질에 어떤 기여를 하는가?
  • RQ5내재적 평가와 외재적 평가의 비교적 영향은 스테머 성능 평가에 어떻게 작용하는가?

주요 결과

  • Paice의 방법을 사용한 내재적 평가에서 스테머는 높은 정밀도를 기록하여 기초 성능이 우수함을 나타낸다.
  • tf-idf 기반 정보 검색 시스템에서 스테머의 사용으로 검색 정확도 향상이 명확하게 관측되었다.
  • 다항분포 나이브 베이즈 주제 분류기에서는 스테밍된 텍스트로 학습한 경우가 비스테밍 입력보다 분류 정확도가 향상되었다.
  • 예외 단어 처리 및 형태소 정규화가 비표준 어형으로 인한 오류를 크게 감소시켰다.
  • 스테머는 내재적 및 외재적 평가 환경에서 일관된 성능을 보이며 실용적 유용성을 검증하였다.
  • 이 연구는 복잡한 파생어 체계와 제한된 NLP 자원을 가진 니파리어에 대해 규칙 기반 스테밍이 효과적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.