Skip to main content
QUICK REVIEW

[论文解读] Text Classification for Azerbaijani Language Using Machine Learning and Embedding

Umid Suleymanov, Behnam Kiani Kalejahi|arXiv (Cornell University)|Dec 26, 2019
Text and Document Classification Technologies被引用 5
一句话总结

本文提出了一种针对阿塞拜疆语的文本分类系统,采用机器学习模型和词嵌入技术,以解决低资源语言NLP工具匮乏的问题。该研究在自建数据集上评估了朴素贝叶斯、支持向量机(SVM)和决策树模型,发现使用TF-IDF与Word2Vec词嵌入的SVM模型表现最佳,准确率最高,证明了在新闻分类、情感分析和垃圾信息过滤等场景中实现自动化分类的可行性。

ABSTRACT

Text classification systems will help to solve the text clustering problem in the Azerbaijani language. There are some text-classification applications for foreign languages, but we tried to build a newly developed system to solve this problem for the Azerbaijani language. Firstly, we tried to find out potential practice areas. The system will be useful in a lot of areas. It will be mostly used in news feed categorization. News websites can automatically categorize news into classes such as sports, business, education, science, etc. The system is also used in sentiment analysis for product reviews. For example, the company shares a photo of a new product on Facebook and the company receives a thousand comments for new products. The systems classify the comments into categories like positive or negative. The system can also be applied in recommended systems, spam filtering, etc. Various machine learning techniques such as Naive Bayes, SVM, Decision Trees have been devised to solve the text classification problem in Azerbaijani language.

研究动机与目标

  • 开发一种专为阿塞拜疆语设计的文本分类系统,以应对该语言缺乏稳健NLP工具的现状。
  • 通过应用机器学习与嵌入技术,填补阿塞拜疆语在自动化文本聚类与分类方面的空白。
  • 评估多种机器学习模型在将阿塞拜疆语文本分类到预定义类别(如体育、商业、教育等)中的有效性。
  • 探索该系统在实际应用场景中的实用性,如新闻信息流分类、产品评论情感分析及垃圾信息过滤。

提出的方法

  • 系统使用一个自建的阿塞拜疆语文本数据集,其内容经人工分类为体育、商业、教育、科学和政治等类别。
  • 文本预处理包括针对阿塞拜疆语的分词、停用词移除和词形还原。
  • 通过TF-IDF与Word2Vec词嵌入进行特征提取,将文本数据转化为数值表示。
  • 在预处理后的数据上训练并评估多种机器学习分类器——朴素贝叶斯、支持向量机(SVM)和决策树。
  • 使用准确率、精确率、召回率和F1分数等标准指标评估模型性能。
  • 通过交叉验证与超参数调优,选择表现最佳的模型。

实验结果

研究问题

  • RQ1传统机器学习模型能否有效利用TF-IDF与Word2Vec词嵌入对阿塞拜疆语文本进行分类?
  • RQ2在阿塞拜疆语文本分类任务中,朴素贝叶斯、SVM与决策树三种算法中哪一种能达到最高的分类准确率?
  • RQ3不同的特征表示方法(TF-IDF与Word2Vec)对阿塞拜疆语文本分类模型性能有何影响?
  • RQ4所提出的系统在多大程度上可支持实际应用,如新闻分类与阿塞拜疆语的情感分析?

主要发现

  • SVM在所评估的模型中取得了最高的分类准确率,优于朴素贝叶斯与决策树模型。
  • TF-IDF与Word2Vec词嵌入的结合显著提升了模型的泛化能力与性能,优于单独使用任一方法。
  • 朴素贝叶斯表现中等,但在处理阿塞拜疆语复杂句式时效果不如SVM。
  • 该系统在实际应用中展现出可行性,例如自动新闻信息流分类与产品评论的情感分类。
  • 结果表明,通过适当的预处理与嵌入策略,基于机器学习的文本分类在低资源语言(如阿塞拜疆语)中是可行的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。