Skip to main content
QUICK REVIEW

[论文解读] A Nepali Rule Based Stemmer and its performance on different NLP applications

Pravesh Koirala, Aman Shakya|arXiv (Cornell University)|Feb 23, 2020
Natural Language Processing Techniques参考文献 1被引用 9
一句话总结

本文提出了一种基于规则的尼泊尔语词干提取器,通过词形归一化、例外词处理和词形变换,剥离两类词尾和一个否定前缀(Na)。在基于tf-idf的信息检索和朴素贝叶斯主题分类的内在(Paice方法)与外在测试中进行了评估,该词干提取器显著提升了性能,证明其在尼泊尔语自然语言处理应用中的有效性。

ABSTRACT

Stemming is an integral part of Natural Language Processing (NLP). It's a preprocessing step in almost every NLP application. Arguably, the most important usage of stemming is in Information Retrieval (IR). While there are lots of work done on stemming in languages like English, Nepali stemming has only a few works. This study focuses on creating a Rule Based stemmer for Nepali text. Specifically, it is an affix stripping system that identifies two different class of suffixes in Nepali grammar and strips them separately. Only a single negativity prefix (Na) is identified and stripped. This study focuses on a number of techniques like exception word identification, morphological normalization and word transformation to increase stemming performance. The stemmer is tested intrinsically using Paice's method and extrinsically on a basic tf-idf based IR system and an elementary news topic classifier using Multinomial Naive Bayes Classifier. The difference in performance of these systems with and without using the stemmer is analysed.

研究动机与目标

  • 开发一种专为尼泊尔语设计的基于规则的词干提取器,尼泊尔语是一种低资源语言,此前针对该语言的词干提取研究有限。
  • 通过聚焦词缀剥离和词形归一化,弥补尼泊尔语自然语言处理中有效预处理工具的不足。
  • 通过识别例外词和使用词形变换技术,提升词干提取的准确性。
  • 评估词干提取器在真实世界自然语言处理任务(如信息检索和文本分类)中的影响。
  • 展示该词干提取器在提升多种自然语言处理应用系统性能方面的实际效用。

提出的方法

  • 该词干提取器采用词缀剥离机制,针对尼泊尔语语法中的两类不同词尾。
  • 识别并剥离单词前的单一否定前缀 'Na',以提升词形一致性。
  • 手动整理例外词并单独处理,以防止过度剥离并保持词汇完整性。
  • 应用词形归一化以标准化词形,提升处理一致性。
  • 使用词形变换规则处理尼泊尔语词汇中不规则或非标准的屈折形式。
  • 系统通过Paice的内在方法以及在外在测试中基于tf-idf的信息检索系统和多项式朴素贝叶斯主题分类器进行评估。

实验结果

研究问题

  • RQ1所提出的基于规则的词干提取器在将尼泊尔语词形还原为词根形式方面的有效性如何?
  • RQ2该词干提取器在基于tf-idf的信息检索系统中能多大程度上提升性能?
  • RQ3该词干提取器能否提升使用多项式朴素贝叶斯的文本分类系统的分类准确率?
  • RQ4词形归一化和例外词处理在整体词干提取质量中起到了何种贡献?
  • RQ5内在评估与外在评估对词干提取器性能评估的相对影响是什么?

主要发现

  • 在使用Paice方法的内在评估中,该词干提取器表现出较高的精确度,表明其具备出色的基线性能。
  • 在基于tf-idf的信息检索系统中,使用该词干提取器显著提升了检索准确率。
  • 当使用词干化文本进行训练时,多项式朴素贝叶斯主题分类器的分类准确率得到提升,优于未词干化输入。
  • 例外词处理和词形归一化显著减少了由不规则词形引起错误。
  • 该词干提取器在内在与外在评估设置中均表现出一致的性能,验证了其实际效用。
  • 本研究证实,基于规则的词干提取对尼泊尔语是有效的,尽管该语言具有复杂的屈折形态且自然语言处理资源有限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。