Skip to main content
QUICK REVIEW

[论文解读] NUIG-Shubhanker@Dravidian-CodeMix-FIRE2020: Sentiment Analysis of Code-Mixed Dravidian text using XLNet

Shubhanker Banerjee, Arun Jayapal|arXiv (Cornell University)|Oct 15, 2020
Natural Language Processing Techniques参考文献 24被引用 5
一句话总结

本文提出对 XLNet 语言模型进行微调,以实现对混合使用德拉威语-英语社交媒体文本的情感分析,具体针对泰米尔-英语(Tanglish)和马拉雅拉姆-英语数据集,且无需额外预处理。尽管在马拉雅拉姆-英语数据集上达到 49% 的准确率,在泰米尔-英语数据集上达到 35% 的准确率,但结果受限于类别不平衡和数据噪声,表明通过延长训练和数据增强可能进一步提升性能。

ABSTRACT

Social media has penetrated into multilingual societies, however most of them use English to be a preferred language for communication. So it looks natural for them to mix their cultural language with English during conversations resulting in abundance of multilingual data, call this code-mixed data, available in todays' world.Downstream NLP tasks using such data is challenging due to the semantic nature of it being spread across multiple languages.One such Natural Language Processing task is sentiment analysis, for this we use an auto-regressive XLNet model to perform sentiment analysis on code-mixed Tamil-English and Malayalam-English datasets.

研究动机与目标

  • 为解决在低资源、语义复杂的混合使用德拉威语-英语社交媒体文本上进行情感分析的挑战。
  • 评估预训练的 XLNet 模型在低资源混合使用数据集上进行情感分类的有效性,且无需大量预处理。
  • 在情感分类背景下,探究马拉雅拉姆-英语与泰米尔-英语混合使用数据集之间的性能差异。
  • 识别模型性能的局限性,特别是由类别不平衡和数据质量引起的,并提出改进建议。

提出的方法

  • 使用 4 个训练周期和最大初始学习率为 0.005,对预训练的 XLNet 模型在泰米尔-英语和马拉雅拉姆-英语混合文本的标注数据集上进行微调。
  • 利用 XLNet 的双流注意力机制,通过在自回归预测过程中同时关注左、右标记来建模双向上下文。
  • 应用排列语言建模方法,对输入序列的所有可能排列进行训练,使 XLNet 能够从两个方向学习上下文依赖关系。
  • 采用标准的 Transformer 架构,结合多头自注意力机制,以捕捉混合文本序列中的长距离依赖关系。
  • 使用 XLNet 输出中 [CLS] 标记的最终隐藏状态进行情感分类,随后通过 Softmax 层实现多分类预测。
  • 按照 FIRE 2020 竞赛的设定,将数据集划分为训练集、验证集和测试集,其中泰米尔-英语数据集包含 15,744 个句子,马拉雅拉姆-英语数据集包含 6,738 个句子。

实验结果

研究问题

  • RQ1XLNet 模型是否能在无需额外预处理的情况下,有效执行低资源混合使用德拉威语-英语文本的情感分析?
  • RQ2考虑到数据质量和规模的差异,模型在马拉雅拉姆-英语与泰米尔-英语混合使用数据集上的性能表现有何不同?
  • RQ3训练数据中的类别不平衡在多大程度上影响了模型对少数情感类别预测性能?
  • RQ4除了使用标准超参数对 XLNet 进行微调外,还能采取哪些措施进一步提升混合使用德拉威语文本的情感分类准确率?

主要发现

  • 模型在马拉雅拉姆-英语数据集上的测试准确率为 49%,在泰米尔-英语数据集上为 35%,表明在低资源混合使用文本上表现中等。
  • 马拉雅拉姆-英语数据集的加权 F1 平均值为 0.52,泰米尔-英语数据集为 0.32,反映出两个数据集之间存在显著性能差距。
  • 在马拉雅拉姆-英语数据集中,正面情感类别的 F1 得分最高(0.59),在泰米尔-英语数据集中为 0.51,表明模型对多数类别有更好对齐。
  • 在马拉雅拉姆-英语数据集中,‘复杂情感’和‘负面’类别的 F1 得分最低(分别为 0.05 和 0.19),表明对细微或负面情感的检测能力较差。
  • 模型在‘非马拉雅拉姆’和‘非泰米尔’类别上的表现较差,F1 得分分别为 0.44 和 0.16,表明在混合语境下语言识别存在挑战。
  • 作者将泰米尔-英语数据集性能较低的原因归因于数据中更高的噪声水平,尽管其数据量大于马拉雅拉姆-英语数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。