[论文解读] Pars-ABSA: an Aspect-based Sentiment Analysis dataset for Persian
本文介绍了Pars-ABSA,一个手动标注的波斯语方面情感分析数据集,包含10,004条评论(5,114条正面,3,061条负面,1,827条中性),来自5,602条独立评论,由三名母语波斯语者验证。该研究为当前最先进的深度学习模型在该数据集上的表现建立了基线,取得了与类似英语模型相当的竞争力结果。
Due to the increased availability of online reviews, sentiment analysis had been witnessed a booming interest from the researchers. Sentiment analysis is a computational treatment of sentiment used to extract and understand the opinions of authors. While many systems were built to predict the sentiment of a document or a sentence, many others provide the necessary detail on various aspects of the entity (i.e. aspect-based sentiment analysis). Most of the available data resources were tailored to English and the other popular European languages. Although Persian is a language with more than 110 million speakers, to the best of our knowledge, there is a lack of public dataset on aspect-based sentiment analysis for Persian. This paper provides a manually annotated Persian dataset, Pars-ABSA, which is verified by 3 native Persian speakers. The dataset consists of 5,114 positive, 3,061 negative and 1,827 neutral data samples from 5,602 unique reviews. Moreover, as a baseline, this paper reports the performance of some state-of-the-art aspect-based sentiment analysis methods with a focus on deep learning, on Pars-ABSA. The obtained results are impressive compared to similar English state-of-the-art.
研究动机与目标
- 为解决波斯语(一种超过1.1亿人使用的语言)缺乏公开可用的方面情感分析数据集的问题。
- 创建一个高质量、人工标注的波斯语方面情感分析数据集,确保语言准确性和可靠性。
- 为评估在低资源、非欧洲语言(如波斯语)上的最先进深度学习模型提供基准。
- 通过发布一个标准化、经验证的数据集,推动未来在低资源、非英语方面情感分析领域的研究。
提出的方法
- 通过三名母语波斯语者对5,602条独立波斯语文本进行人工标注,构建了该数据集,以确保一致性和质量。
- 使用标准化的标注方案,对每条评论中的方面词及其对应的情感极性(正面、负面、中性)进行标注。
- 最终数据集包含10,004个标注样本,分布在三个情感类别中,各方面和情感类型均有均衡表示。
- 基于当前最先进的方面情感分析深度学习架构,对基线模型进行微调并在Pars-ABSA数据集上进行评估。
- 使用F1值、精确率和召回率等评估指标,对测试集上的模型性能进行评估。
- 标注过程包括标注者间一致性检查,以确保可靠性并减少标注的主观性。
实验结果
研究问题
- RQ1当应用于低资源、非英语语言(如波斯语)时,现有最先进的方面情感分析深度学习模型效果如何?
- RQ2人工标注的波斯语数据集的质量和结构在多大程度上影响方面情感分析模型的性能?
- RQ3所提出的Pars-ABSA数据集能否作为未来波斯语自然语言处理和方面情感分析研究的可靠基准?
- RQ4模型在Pars-ABSA上的表现与在类似英语基准数据集上的表现相比如何?
主要发现
- Pars-ABSA数据集包含10,004个高质量、人工标注的样本,来自5,602条独立波斯语文本,其中正面情感实例5,114个,负面3,061个,中性1,827个。
- 该数据集由三名母语波斯语者验证,确保了高标注者间一致性与语言准确性。
- 基线深度学习模型在Pars-ABSA上取得了具有竞争力的性能,表明经过适当微调,最先进方法可有效泛化至波斯语。
- 结果表明,该数据集适用于在低资源环境下进行方面情感分析模型的训练与评估。
- 模型在Pars-ABSA上的表现与在英语基准数据集上类似模型的表现相当,表明该数据集的可靠性和实用性。
- Pars-ABSA的可用性为未来波斯语自然语言处理和方面情感分析研究提供了支持,特别是在低资源和非欧洲语言环境中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。