[论文解读] A Simple and Efficient Ensemble Classifier Combining Multiple Neural Network Models on Social Media Datasets in Vietnamese
该论文提出了一种简单但高效的集成分类器,结合CNN、LSTM和BERT模型,用于越南语社交媒体数据集上的多类别文本分类。通过利用各模型的独特优势并优化预处理,该集成模型在三个基准数据集上取得了当前最优的F1分数:HSD-VLSP数据集为86.96%,UIT-VSMEC数据集为65.79%,UIT-VSFC数据集在情感分类任务中达到92.79%,在主题分类任务中达到89.70%,优于单一模型和先前研究工作。
Text classification is a popular topic of natural language processing, which has currently attracted numerous research efforts worldwide. The significant increase of data in social media requires the vast attention of researchers to analyze such data. There are various studies in this field in many languages but limited to the Vietnamese language. Therefore, this study aims to classify Vietnamese texts on social media from three different Vietnamese benchmark datasets. Advanced deep learning models are used and optimized in this study, including CNN, LSTM, and their variants. We also implement the BERT, which has never been applied to the datasets. Our experiments find a suitable model for classification tasks on each specific dataset. To take advantage of single models, we propose an ensemble model, combining the highest-performance models. Our single models reach positive results on each dataset. Moreover, our ensemble model achieves the best performance on all three datasets. We reach 86.96% of F1- score for the HSD-VLSP dataset, 65.79% of F1-score for the UIT-VSMEC dataset, 92.79% and 89.70% for sentiments and topics on the UIT-VSFC dataset, respectively. Therefore, our models achieve better performances as compared to previous studies on these datasets.
研究动机与目标
- 解决在社交媒体上针对越南语多类别文本分类缺乏有效深度学习模型的问题。
- 评估CNN、LSTM和BERT模型在三个具有多标签和类别不平衡特性的越南语基准数据集上的性能。
- 设计并实现一种集成方法,结合各模型的优势以提升整体分类准确率。
- 研究预处理和领域特定词嵌入对越南语社交媒体文本分类性能的影响。
- 为未来基于深度学习的越南语NLP任务建立基准。
提出的方法
- 使用预训练的fastText词向量在越南语社交媒体文本上训练并优化CNN和LSTM及其变体。
- 首次在三个越南语数据集上应用BERT模型,并通过微调实现多类别分类。
- 实现了一种归一化的词典以改善词表示,并处理因拼写错误导致的OOV(未登录词)问题。
- 采用五折交叉验证评估模型性能,确保结果的稳健性。
- 通过结合表现最佳的单模型预测结果构建集成模型,并基于每折的性能结果对标签进行特定加权。
- 根据数据集大小和领域特性,对模型深度和超参数进行优化。
实验结果
研究问题
- RQ1CNN、LSTM和BERT模型在越南语社交媒体文本分类任务中的表现如何?
- RQ2在多标签、类别不平衡的越南语数据集上,多个神经网络模型的集成是否能超越单个模型的分类性能?
- RQ3预处理和领域特定词嵌入对越南语社交媒体文本分类准确率有何影响?
- RQ4哪种模型架构在不同折和数据集上表现出最高的稳定性和性能?
- RQ5BERT是否在越南语文本上优于传统模型,尤其是在小样本或领域特定数据集上?
主要发现
- 在HSD-VLSP数据集上,集成模型在仇恨言论检测任务中取得了86.96%的最高F1分数,超越所有单模型和先前研究。
- 在UIT-VSMEC数据集上,集成模型在情感识别任务中达到65.79%的F1分数,优于以往方法。
- 在UIT-VSFC数据集上,集成模型在情感分类任务中取得92.79%的F1分数,在主题分类任务中达到89.70%,展现出在多标签任务中的强劲性能。
- CNN模型在所有折中表现最为稳定,在HSD-VLSP数据集的CLEAN标签上达到99.42%的准确率。
- LSTM模型在HATE标签上表现最佳(准确率为85.10%),而集成模型通过融合其预测结果,将该指标提升至85.39%。
- 预处理在大型数据集(如HSD-VLSP)上具有积极影响,但在小型数据集(如UIT-VSMEC)上反而降低了性能,表明需根据数据集大小进行针对性优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。