Skip to main content
QUICK REVIEW

[论文解读] Supervised learning Methods for Bangla Web Document Categorization

Ashis Kumar Mandal, Rikta Sen|arXiv (Cornell University)|Oct 8, 2014
Text and Document Classification Technologies参考文献 21被引用 8
一句话总结

本文评估了四种监督学习方法——C4.5决策树、K近邻(KNN)、朴素贝叶斯(NB)和支持向量机(SVM)——在使用自建波纳格语语料库进行波纳格语文档分类中的表现。结果表明,SVM在高维和噪声较大的特征向量上表现优于其他方法,显示出在波纳格语文本分类任务中的强大有效性。

ABSTRACT

This paper explores the use of machine learning approaches, or more specifically, four supervised learning Methods, namely Decision Tree(C 4.5), K-Nearest Neighbour (KNN), Naïve Bays (NB), and Support Vector Machine (SVM) for categorization of Bangla web documents. This is a task of automatically sorting a set of documents into categories from a predefined set. Whereas a wide range of methods have been applied to English text categorization, relatively few studies have been conducted on Bangla language text categorization. Hence, we attempt to analyze the efficiency of those four methods for categorization of Bangla documents. In order to validate, Bangla corpus from various websites has been developed and used as examples for the experiment. For Bangla, empirical results support that all four methods produce satisfactory performance with SVM attaining good result in terms of high dimensional and relatively noisy document feature vectors.

研究动机与目标

  • 通过评估多种机器学习方法,解决波纳格语文本分类中监督学习研究稀缺的问题。
  • 构建并利用一个领域特定的波纳格语文档网络语料库,用于训练和测试分类模型。
  • 比较四种成熟监督学习算法在波纳格语文本数据上的性能表现。
  • 识别在处理波纳格语文档分类中高维和噪声特征向量时最有效的算法。
  • 为未来波纳格语自然语言处理研究提供一个经过验证的基准。

提出的方法

  • 将四种监督学习算法——C4.5决策树、K近邻(KNN)、朴素贝叶斯(NB)和支持向量机(SVM)——应用于波纳格语文本分类任务。
  • 从多个网站构建了一个自定义的波纳格语文档语料库,用作训练和测试数据。
  • 文本预处理包括针对波纳格语文字系统和词形特征定制的分词与特征提取。
  • 使用词袋模型或类似表示技术生成文档向量,将文本转换为数值特征。
  • 在语料库上训练分类模型,并使用准确率、精确率和召回率等标准指标进行评估。
  • 通过实验比较在不同特征维度和噪声水平下各模型的性能表现。

实验结果

研究问题

  • RQ1哪种监督学习方法在波纳格语文档分类中达到最高准确率?
  • RQ2在高维和噪声较大的波纳格语文本特征向量上,C4.5、KNN、NB和SVM四种方法的表现如何?
  • RQ3与英文语境相比,算法选择在波纳格语文本分类中的性能影响有多大?
  • RQ4自建波纳格语语料库在支持监督学习进行文档分类方面有多有效?
  • RQ5SVM在波纳格语文本分类中是否表现出对特征噪声和维度的更强鲁棒性?

主要发现

  • 支持向量机(SVM)在所有四种方法中对波纳格语文档分类的性能最高。
  • SVM在高维和相对嘈杂的文档特征向量上表现出强大的鲁棒性和有效性。
  • 朴素贝叶斯(NB)和K近邻(KNN)表现出令人满意但低于SVM的性能。
  • C4.5决策树方法表现尚可,但在给定的波纳格语文本语料库上不如SVM有效。
  • 实证结果证实,通过适当的特征工程,监督学习方法可有效应用于波纳格语文本分类。
  • 本研究确立了SVM在测试条件下作为波纳格语文档分类最合适的算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。