[论文解读] Text classification dataset and analysis for Uzbek language
本文介绍了一个用于乌兹别克语的新型多标签文本分类数据集,该数据集从15个类别的10个新闻和新闻网站收集而成。该研究评估了传统模型与深度学习模型,结果表明基于Transformer的BERTbek模型在性能上优于RNN、CNN和基于规则的模型,为未来乌兹别克语自然语言处理研究建立了强有力的基线。
Text classification is an important task in Natural Language Processing (NLP), where the goal is to categorize text data into predefined classes. In this study, we analyse the dataset creation steps and evaluation techniques of multi-label news categorisation task as part of text classification. We first present a newly obtained dataset for Uzbek text classification, which was collected from 10 different news and press websites and covers 15 categories of news, press and law texts. We also present a comprehensive evaluation of different models, ranging from traditional bag-of-words models to deep learning architectures, on this newly created dataset. Our experiments show that the Recurrent Neural Network (RNN) and Convolutional Neural Network (CNN) based models outperform the rule-based models. The best performance is achieved by the BERTbek model, which is a transformer-based BERT model trained on the Uzbek corpus. Our findings provide a good baseline for further research in Uzbek text classification.
研究动机与目标
- 创建一个大规模的、用于乌兹别克语的多标签文本分类数据集,以支持自然语言处理研究。
- 评估从词袋模型到深度学习模型等多种模型在乌兹别克语文本分类任务上的性能。
- 通过对比基于规则、RNN、CNN和基于Transformer的模型,为未来低资源乌兹别克语自然语言处理研究建立基准。
- 分析用于低资源语言(如乌兹别克语)多标签新闻分类的数据集构建技术和评估协议。
提出的方法
- 从10个不同来源的乌兹别克语新闻和新闻网站收集文本数据,以确保涵盖广泛的主题和文体。
- 使用15个预定义类别(包括新闻、新闻稿和法律文本)对数据集进行标注,以支持多标签分类。
- 实现并评估了多种模型:基于规则的分类器、基于词袋模型的SVM、RNN、CNN以及在乌兹别克语语料库上微调的BERTbek模型。
- 应用标准的自然语言处理预处理步骤,包括分词和序列填充,以准备深度学习模型的数据。
- 使用标准评估指标(如宏F1、微F1和准确率)在不同类别间比较模型性能。
- 对BERTbek模型进行微调——该模型是基于多语言BERT的变体,并在乌兹别克语文本上进行了预训练——以优化多标签分类任务。
实验结果
研究问题
- RQ1基于规则和传统机器学习模型在乌兹别克语文本分类任务中的表现如何?
- RQ2RNN和CNN架构在分类多标签乌兹别克语文本时表现如何比较?
- RQ3在乌兹别克语数据上微调的基于BERT的模型相较于非Transformer模型,在分类准确率方面提升了多少?
- RQ4在构建高质量、多标签数据集时,对于低资源语言(如乌兹别克语)面临哪些关键挑战?
主要发现
- BERTbek模型在乌兹别克语文本分类数据集上表现最佳,优于所有其他模型,包括RNN和CNN。
- RNN和CNN模型相较于基于规则的基线模型有显著提升,表明深度学习在乌兹别克语自然语言处理中的价值。
- 该多标签数据集涵盖15个不同的类别,内容涵盖新闻、新闻稿和法律文本,增强了其代表性。
- 本研究为乌兹别克语文本分类建立了新基准,BERTbek为未来研究设定了强有力的性能基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。