Skip to main content
QUICK REVIEW

[论文解读] IIITT@LT-EDI-EACL2021-Hope Speech Detection: There is always Hope in Transformers

Karthik Puranik, Adeep Hande|arXiv (Cornell University)|Apr 19, 2021
Hate Speech and Cyberbullying Detection参考文献 34被引用 14
一句话总结

本文提出了一种基于多语言Transformer的模型,用于在英语、泰米尔语和马拉雅拉姆语的社交媒体评论中检测希望话语,利用了CharacterBERT、mBERT和MuRIL等模型。该方法在英语上的F1得分最高,达到0.9356,在马拉雅拉姆语上为0.8545,在泰米尔语上为0.5926,证明了微调后的Transformer模型在识别积极、支持性内容以对抗仇恨言论方面的有效性。

ABSTRACT

In a world filled with serious challenges like climate change, religious and political conflicts, global pandemics, terrorism, and racial discrimination, an internet full of hate speech, abusive and offensive content is the last thing we desire for. In this paper, we work to identify and promote positive and supportive content on these platforms. We work with several transformer-based models to classify social media comments as hope speech or not-hope speech in English, Malayalam and Tamil languages. This paper portrays our work for the Shared Task on Hope Speech Detection for Equality, Diversity, and Inclusion at LT-EDI 2021- EACL 2021.

研究动机与目标

  • 为应对社交媒体平台上日益增长的检测和推广积极、支持性内容的需求,以对抗仇恨言论和网络欺凌。
  • 对英语、泰米尔语和马拉雅拉姆语的社交媒体评论进行分类,判断其是否为希望话语,重点关注多语言和代码混合的数据。
  • 评估多种预训练Transformer模型在低资源印度语言中检测希望话语的性能。
  • 通过识别和放大危机时期体现希望、韧性和包容性的信息,改善网络话语环境。

提出的方法

  • 在共享任务数据集上对多种多语言和单语言Transformer模型(包括BERT、RoBERTa、XLM-RoBERTa、mBERT、MuRIL、IndicBERT和CharacterBERT)进行微调。
  • 采用迁移学习技术,使用在多语言和印度语言语料库(包括Common Crawl、Wikipedia和Dakshina)上预训练的模型。
  • 在Transformer编码器之上使用全连接层和BiLSTM架构,以增强序列建模和分类性能。
  • 应用数据增强和类别平衡技术,减轻数据集中类别不平衡的影响,特别是在英语和马拉雅拉姆语中。
  • 使用加权F1得分作为主要指标,在保留10%的总59,354条评论的测试集上评估模型性能。
  • 实现了一种字符感知模型CharacterBERT,以提升对社交媒体文本中常见未登录词和非标准拼写的鲁棒性。

实验结果

研究问题

  • RQ1在泰米尔语和马拉雅拉姆语等低资源印度语言中,哪种基于Transformer的模型在希望话语检测中表现最佳?
  • RQ2由于数据分布和语言特征的差异,模型在英语、泰米尔语和马拉雅拉姆语上的表现有何变化?
  • RQ3类别不平衡和多语言干扰在多大程度上影响希望话语检测模型的泛化能力?
  • RQ4字符级表征在噪声大、代码混合或非标准社交媒体文本上的性能提升程度如何?
  • RQ5多语言模型如mBERT和XLM-RoBERTa与单语言或语言特定模型相比,在希望话语检测中的表现如何?

主要发现

  • CharacterBERT在英语测试集上取得了0.9356的最高F1得分,优于其他模型(包括BERT、RoBERTa和DistilBERT)。
  • mBERT-uncased配合BiLSTM在马拉雅拉姆语测试集上取得了0.8545的F1得分,优于其他多语言模型。
  • 在泰米尔语中,distilBERT取得了加权F1得分0.5926,但其性能在验证集到测试集之间显著下降,表明存在数据分布偏移问题。
  • mBERT-cased模型配合BiLSTM在从验证集(0.6183)到测试集的F1得分出现了8%的急剧下降,表明存在过拟合或数据分布偏移问题。
  • 多语言模型如mBERT和XLM-RoBERTa在测试集上性能最高下降达15%,可能由于代码混合和非母语脚本的干扰。
  • 类别不平衡和非英语语言干扰显著影响了模型的泛化能力,尤其在英语和马拉雅拉姆语数据集中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。