[论文解读] Sentiment Analysis for Sinhala Language using Deep Learning Techniques
本论文针对低资源的僧伽罗语,采用深度学习模型对多类别情感分析进行了全面研究,包括RNN、LSTM、Bi-LSTM、层次注意力网络和胶囊网络。研究提出了目前公开可用的最大僧伽罗语情感数据集,包含15,059条评论,分为四种类别(POSITIVE、NEGATIVE、NEUTRAL、CONFLICT),在10折交叉验证下,使用胶囊-B架构实现了59.11%的最佳加权F1分数。
Due to the high impact of the fast-evolving fields of machine learning and deep learning, Natural Language Processing (NLP) tasks have further obtained comprehensive performances for highly resourced languages such as English and Chinese. However Sinhala, which is an under-resourced language with a rich morphology, has not experienced these advancements. For sentiment analysis, there exists only two previous research with deep learning approaches, which focused only on document-level sentiment analysis for the binary case. They experimented with only three types of deep learning models. In contrast, this paper presents a much comprehensive study on the use of standard sequence models such as RNN, LSTM, Bi-LSTM, as well as more recent state-of-the-art models such as hierarchical attention hybrid neural networks, and capsule networks. Classification is done at document-level but with more granularity by considering POSITIVE, NEGATIVE, NEUTRAL, and CONFLICT classes. A data set of 15059 Sinhala news comments, annotated with these four classes and a corpus consists of 9.48 million tokens are publicly released. This is the largest sentiment annotated data set for Sinhala so far.
研究动机与目标
- 为解决僧伽罗语情感分析中缺乏大规模、多类别标注数据集的问题,特别是超越二元分类的限制。
- 评估一系列深度学习架构(从标准RNN到最先进的胶囊网络)在僧伽罗语文本级别情感分类中的表现。
- 探讨语言无关的词嵌入(Word2Vec、fastText)在僧伽罗语等词形丰富的低资源自然语言处理任务中的有效性。
- 提供公开可访问的代码库、预训练词嵌入以及大规模标注数据集,以支持未来僧伽罗语自然语言处理研究。
提出的方法
- 从两个在线报纸GossipLanka和Lankadeepa收集了15,059条僧伽罗语文本评论,构建了一个新数据集,并将其标注为四种类别:POSITIVE、NEGATIVE、NEUTRAL和CONFLICT。
- 在模型训练前,通过分词、标准化以及去除非僧伽罗语字符对文本进行预处理,以减少噪声。
- 在包含948万词的未标注语料库上,使用Word2Vec和fastText训练预训练词嵌入,以提升表征学习效果。
- 训练并比较了多种深度学习模型:RNN、LSTM、GRU、Bi-LSTM、堆叠变体、CNN+GRU/LSTM/BiLSTM、HAHNN以及胶囊网络(capsule-A和capsule-B)。
- 采用10折交叉验证和保留验证来评估模型性能,主要指标为加权准确率和F1分数。
- 在HAHNN中使用注意力机制,在胶囊网络中采用姿态共变路由机制,以更好地捕捉文本中的层次化和结构化依赖关系。
实验结果
研究问题
- RQ1在低资源、词形丰富的语言如僧伽罗语中,哪些深度学习架构在多类别情感分类任务中表现最佳?
- RQ2与二元分类相比,引入多类别情感标签(包括NEUTRAL和CONFLICT)如何提升情感分析的粒度和现实感?
- RQ3语言无关的词嵌入在僧伽罗语等低资源自然语言处理任务中,能在多大程度上提升性能?
- RQ4注意力机制与胶囊网络在建模僧伽罗语文本中的长距离依赖关系和情感组合性方面,表现如何比较?
- RQ5僧伽罗语情感分析中的主要误分类来源是什么?它们与类别不平衡和语言复杂性有何关联?
主要发现
- 胶囊-B模型在10折交叉验证下取得了最佳性能,加权F1分数为59.11%,加权准确率为63.23%。
- Bi-LSTM和堆叠Bi-LSTM模型优于标准RNN和LSTM,表明在僧伽罗语中双向上下文建模具有显著优势。
- HAHNN模型的加权F1分数达到59.25%,表明层次注意力机制能够有效建模句子和词级别的情感线索。
- 胶囊网络,特别是胶囊-B,优于RNN和基础LSTM等简单架构,表明其在低资源语言中建模复杂句法和语义关系方面具有潜力。
- 混淆矩阵显示,NEUTRAL和CONFLICT类别常被误分类为NEGATIVE,主要原因是类别不平衡以及混合情感表达的存在。
- 尽管整体性能较低,本研究仍提供了清晰的基准和深度学习模型的对比分析,明确识别出胶囊-B和堆叠Bi-LSTM为僧伽罗语情感分析中的最优架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。