Skip to main content
QUICK REVIEW

[论文解读] A hybrid learning algorithm for text classification

S. M. Kamruzzaman, Farhana Haider|arXiv (Cornell University)|Sep 23, 2010
Data Mining Algorithms and Applications参考文献 5被引用 13
一句话总结

该论文提出了一种混合文本分类算法,利用词关联规则从有限的训练数据中提取特征,对这些衍生特征应用朴素贝叶斯分类器,并使用单一遗传算法进行最终分类。该方法在减少训练数据需求的同时实现了比现有系统更高的准确率,展示了在低数据场景下的改进性能。

ABSTRACT

Text classification is the process of classifying documents into predefined categories based on their content. Existing supervised learning algorithms to automatically classify text need sufficient documents to learn accurately. This paper presents a new algorithm for text classification that requires fewer documents for training. Instead of using words, word relation i.e association rules from these words is used to derive feature set from preclassified text documents. The concept of Naive Bayes classifier is then used on derived features and finally only a single concept of Genetic Algorithm has been added for final classification. Experimental results show that the classifier build this way is more accurate than the existing text classification systems.

研究动机与目标

  • 解决有限标注训练文档带来的文本分类挑战。
  • 通过从词关联中提取特征而非依赖单个词汇,减少对大规模训练语料库的依赖。
  • 通过结合关联规则挖掘、朴素贝叶斯与遗传算法优化的混合架构,提升分类准确率。
  • 开发一种更高效利用数据的分类系统,适用于标注文本稀缺的领域。

提出的方法

  • 使用从预分类文档中词共现关系提取的关联规则进行特征提取,替代传统的基于词汇的特征。
  • 所提取的关联规则构成新的特征集,能够捕捉词汇之间的语义关系。
  • 对基于规则的特征集应用朴素贝叶斯分类器进行概率分类。
  • 在最终分类步骤中使用单一遗传算法,基于朴素贝叶斯输出优化决策边界。
  • 该混合模型整合了基于规则的特征工程、概率分类与进化优化。
  • 系统使用来自ICECE 2004会议的标准文本分类数据集进行评估。

实验结果

研究问题

  • RQ1在训练数据有限的情况下,词汇之间的关联规则是否能提升文本分类性能?
  • RQ2与独立模型相比,将朴素贝叶斯与遗传算法结合是否能提升分类准确率?
  • RQ3该混合方法在多大程度上可减少文本分类对大规模训练语料库的需求?
  • RQ4在低数据环境下,基于规则的特征提取方法与传统的词频方法相比表现如何?

主要发现

  • 所提出的混合算法在分类准确率上优于现有文本分类系统。
  • 使用关联规则进行特征提取可在训练文档数量较少的情况下实现有效学习。
  • 在最终分类步骤中集成遗传算法可提升模型性能。
  • 该系统在低数据场景下表现出优越性能,适用于数据稀缺的应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。