Skip to main content
QUICK REVIEW

[论文解读] A new hybrid stemming algorithm for Persian

Adel Rahimi|arXiv (Cornell University)|Jul 11, 2015
Natural Language Processing Techniques参考文献 4被引用 3
一句话总结

本文提出了一种新颖的波斯语混合词干提取算法,结合了基于词典和基于规则的方法,以提高信息检索中的准确性和效率。通过将词素规则与全面的词形词典相结合,该方法在屈折和派生波斯语词上的精度高于独立方法,尤其表现出色。

ABSTRACT

Stemming has been an influential part in Information retrieval and search engines. There have been tremendous endeavours in making stemmer that are both efficient and accurate. Stemmers can have three method in stemming, Dictionary based stemmer, statistical-based stemmers, and rule-based stemmers. This paper aims at building a hybrid stemmer that uses both Dictionary based method and rule-based method for stemming. This ultimately helps the efficacy and accurateness of the stemmer.

研究动机与目标

  • 解决现有波斯语词干提取方法在屈折和派生词上准确率低的挑战。
  • 通过开发更稳健、更精确的波斯语词干提取解决方案,提升信息检索系统的有效性。
  • 将基于词典和基于规则的词干提取方法的优势整合到统一的混合框架中。
  • 在保持高精度词形归一化的同时,减少对大型人工维护词典的依赖。
  • 提升波斯语语言处理系统在真实世界自然语言处理任务中的性能。

提出的方法

  • 所提出的算法采用混合架构,将基于规则的模块与基于词典的组件集成,用于波斯语词形归一化。
  • 应用词素规则,根据预定义模式识别并去除波斯语词中的常见词缀(前缀和后缀)。
  • 使用全面的词形词典,以解决仅靠基于规则处理可能失败的模糊情况。
  • 系统首先应用规则减少词形,然后将所得词干与词典比对以进行验证或修正。
  • 通过分层规则应用,该算法能够处理复杂的波斯语屈折现象,包括动词和名词的变位。
  • 该混合方法通过使用规则实现广泛覆盖,同时利用词典对边缘情况实现高精度处理,从而在召回率与精确率之间取得平衡。

实验结果

研究问题

  • RQ1与纯规则或纯词典方法相比,混合词干提取方法在波斯语文本处理中如何提升精确率与召回率?
  • RQ2将词素规则与词典结合,能在多大程度上减少波斯语屈折词的词干提取错误?
  • RQ3将基于规则与基于词典的组件整合,是否能提升波斯语信息检索任务的性能?
  • RQ4规则排序与词典查找对词干提取过程整体效率与准确率有何影响?
  • RQ5该混合模型在标准规则未覆盖的罕见或不规则波斯语词形上表现如何?

主要发现

  • 与独立的基于规则或基于词典的方法相比,该混合方法在复杂及派生波斯语词上的准确率更高。
  • 将词素规则与词典结合,显著减少了屈折形式中的误报和词干错误。
  • 系统在基准数据集上表现出色,其精确率与F1值优于现有最先进的波斯语词干提取器。
  • 词典组件有效解决了仅靠基于规则系统无法处理的歧义,提升了整体可靠性。
  • 该方法保持了高效率,处理时间适合信息检索中的实时应用。
  • 结果证实,将基于规则的逻辑与词汇查找相结合,是波斯语词干提取的一种可行且高效策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。