[论文解读] AraBERT and Farasa Segmentation Based Approach For Sarcasm and Sentiment Detection in Arabic Tweets
本论文提出了一种两阶段方法,用于使用微调后的 AraBERT 和 AraELECTRA 模型在阿拉伯语推文上进行反讽和情感检测。通过 Farasa 分词和去噪预处理,提升了模型性能,在反讽检测任务上达到 85.55% 的 F1 分数,在情感分析任务上达到 76.41% 的 F1 分数,分别在共享任务中排名第七和第四。
This paper presents our strategy to tackle the EACL WANLP-2021 Shared Task 2: Sarcasm and Sentiment Detection. One of the subtasks aims at developing a system that identifies whether a given Arabic tweet is sarcastic in nature or not, while the other aims to identify the sentiment of the Arabic tweet. We approach the task in two steps. The first step involves pre processing the provided ArSarcasm-v2 dataset by performing insertions, deletions and segmentation operations on various parts of the text. The second step involves experimenting with multiple variants of two transformer based models, AraELECTRA and AraBERT. Our final approach was ranked seventh and fourth in the Sarcasm and Sentiment Detection subtasks respectively.
研究动机与目标
- 解决低资源阿拉伯语社交媒体文本中反讽和情感检测的挑战。
- 通过应用针对性的文本预处理,提升阿拉伯语反讽和情感分类的模型性能。
- 评估 AraBERT 和 AraELECTRA 模型在 ArSarcasm-v2 数据集上进行反讽和情感检测任务的有效性。
- 通过模型微调和预处理优化,在 EACL WANLP-2021 共享任务中实现具有竞争力的性能。
提出的方法
- 通过移除 HTML 标记、URL、提及、电子邮件、表情符号和多余空格来预处理 ArSarcasm-v2 数据集。
- 应用 Farasa 分词以改善特定模型的形态表示。
- 在标点符号、数字和非阿拉伯字符周围插入空格,以增强分词效果。
- 使用 Hugging Face 的 Transformers API 微调多种 AraBERT 和 AraELECTRA 模型变体。
- 采用 1e-5 的初始学习率,批量大小为 40(基础模型)或 4(大模型),最大序列长度为 256,共训练 10 个周期。
- 基于验证集的 F1 分数选择表现最佳的模型变体用于最终测试提交。
实验结果
研究问题
- RQ1Farasa 分词和去噪预处理对阿拉伯语推文反讽和情感检测性能有何影响?
- RQ2在 ArSarcasm-v2 数据集上,哪些 AraBERT 和 AraELECTRA 模型变体在反讽和情感分类任务中表现最佳?
- RQ3基于 Transformer 的模型在阿拉伯语文本上微调后,能否在低资源反讽和情感检测任务中实现优异性能?
- RQ4模型规模(基础 vs. 大型)和版本(v0.1 至 v2)对分类性能有何影响?
主要发现
- AraBERTv2-base 在反讽检测任务(子任务 1)中取得最高的 F1 得分 85.55%,在私有排行榜中排名第七。
- AraBERTv0.2-large 在情感检测任务(子任务 2)中取得最高的 F1 得分 76.41%,在私有排行榜中排名第四。
- AraELECTRA-base-generator 模型在所有任务中表现最差,可能是因为其基于 GAN 的架构并非最适合文本分类任务。
- 模型性能随模型规模增大而提升,如 AraBERTv0.2-large 的 F1 分数高于其基础版本。
- 预处理步骤如 URL 和提及替换以及空白字符规范化显著减少了噪声,提升了模型泛化能力。
- 采用 1e-5 的学习率和 10 个周期的微调在所有测试的模型变体中均取得了最优结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。