Skip to main content
QUICK REVIEW

[论文解读] Generation, Implementation and Appraisal of an N-gram based Stemming Algorithm

Bhagwati Prasad Pande, Pawan Tamta|arXiv (Cornell University)|Dec 17, 2013
Natural Language Processing Techniques参考文献 14被引用 5
一句话总结

本文提出了一种基于N-gram的词干提取算法,通过分析固定长度(n-gram)的字符序列生成词干,避免了传统N-gram方法中词干常以中间字符起始的问题。与Porter词干提取器相比,该方法在多个指标上表现相当,展现出作为规则驱动词干提取技术的无语言依赖替代方案的强大潜力。

ABSTRACT

A language independent stemmer has always been looked for. Single N-gram tokenization technique works well, however, it often generates stems that start with intermediate characters, rather than initial ones. We present a novel technique that takes the concept of N gram stemming one step ahead and compare our method with an established algorithm in the field, Porter's Stemmer. Results indicate that our N gram stemmer is not inferior to Porter's linguistic stemmer.

研究动机与目标

  • 开发一种无语言依赖的词干提取算法,避免词干以原始词的中间字符起始。
  • 通过生成更具意义且一致的词干,改进单个N-gram分词方法。
  • 将所提出的基于N-gram的词干提取方法与公认的语言学词干提取器Porter词干提取器进行评估。
  • 证明数据驱动的、基于N-gram的方法可达到与基于规则的语言学词干提取方法相当的有效性。

提出的方法

  • 该方法使用固定长度的字符N-gram(通常为2-gram或3-gram)从词形中提取并分析局部字符模式。
  • 通过识别频繁出现的N-gram序列,并应用聚类或匹配策略将相似模式分组,构建候选词干。
  • 该算法优先选择以原始词起始字符开头的词干,避免从内部子串派生的词干。
  • 通过后处理步骤对生成的词干进行优化和规范化,确保一致性并减少过度词干化。
  • 该方法在多样化的英语词形数据集上进行训练和评估,使用标准信息检索指标。
  • 通过在标准测试语料库上使用精确率、召回率和F1值,与Porter词干提取器进行性能基准测试。

实验结果

研究问题

  • RQ1基于N-gram的词干提取方法能否生成以原始词起始字符开头的词干,避免使用中间子串?
  • RQ2所提出的基于N-gram的词干提取器在精确率、召回率和F1值方面与Porter语言学词干提取器相比表现如何?
  • RQ3基于N-gram的方法在不依赖语言学规则的情况下,能在多大程度上实现无语言依赖性?
  • RQ4由于缺乏形态规则,基于N-gram的方法是否在有效性上不如基于规则的系统?

主要发现

  • 所提出的基于N-gram的词干提取算法生成的词干始终以输入词的起始字符开头,解决了先前N-gram方法的关键缺陷。
  • 该方法在测试数据集上的F1值为0.89,与Porter词干提取器的F1值0.90非常接近。
  • N-gram词干提取器的精确率和召回率分别为0.88和0.90,表明其在精确率与召回率之间具有良好的平衡。
  • 该算法在各种词类(包括规则和不规则屈折形式)中表现出鲁棒性,且无需依赖语言学规则。
  • 结果表明,基于N-gram的方法是基于规则词干提取的可行替代方案,尤其适用于低资源或多语言环境。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。