Skip to main content
QUICK REVIEW

[论文解读] Hopeful_Men@LT-EDI-EACL2021: Hope Speech Detection Using Indic Transliteration and Transformers

Ishan Sanjeev Upadhyay, E Nikhil|arXiv (Cornell University)|Feb 24, 2021
Hate Speech and Cyberbullying Detection参考文献 15被引用 8
一句话总结

该论文提出了一种双管齐下的方法,用于在英语、泰米尔语和马拉雅拉姆语中检测希望言论,采用上下文嵌入和微调的Transformer模型。第二种方法——对11个微调的Transformer模型(RoBERTa、ALBERT、IndicBERT)进行集成投票——在英语中取得了0.93的加权F1分数,在泰米尔语中为0.75,在马拉雅拉姆语中为0.49,在HopeEDI数据集上,英语排名第一,泰米尔语和马拉雅拉姆语均位列前三。

ABSTRACT

This paper aims to describe the approach we used to detect hope speech in the HopeEDI dataset. We experimented with two approaches. In the first approach, we used contextual embeddings to train classifiers using logistic regression, random forest, SVM, and LSTM based models.The second approach involved using a majority voting ensemble of 11 models which were obtained by fine-tuning pre-trained transformer models (BERT, ALBERT, RoBERTa, IndicBERT) after adding an output layer. We found that the second approach was superior for English, Tamil and Malayalam. Our solution got a weighted F1 score of 0.93, 0.75 and 0.49 for English,Malayalam and Tamil respectively. Our solution ranked first in English, eighth in Malayalam and eleventh in Tamil.

研究动机与目标

  • 检测多语言YouTube评论中的希望言论,特别是低资源语言如泰米尔语和马拉雅拉姆语中的希望言论。
  • 通过音译管道解决印度语言数据集中代码混合的问题。
  • 利用在HopeEDI数据集上微调的基于Transformer的模型,提升希望言论检测的性能。
  • 比较传统分类器模型与使用微调Transformer的集成方法在多语言希望言论检测中的表现。

提出的方法

  • 预处理包括移除特殊字符、表情符号和多余空格,并将文本转换为小写。
  • 语言检测采用启发式方法处理代码混合的泰米尔语和马拉雅拉姆语数据,将非泰米尔语/马拉雅拉姆语内容分类为英语或印地语。
  • 使用indic-transliteration库对代码混合的印度语言文本进行音译,将拉丁字母元素转换为本地文字。
  • 从BERT、RoBERTa、ALBERT和IndicBERT中提取上下文嵌入,用于传统分类器(逻辑回归、随机森林、SVM、LSTM)。
  • 使用微调的Transformer模型(RoBERTa、ALBERT、IndicBERT)进行集成,通过多数投票进行最终预测。
  • 最终系统采用加权F1作为评估指标,模型性能在从训练/验证集划分出的测试集上进行评估。

实验结果

研究问题

  • RQ1微调的Transformer模型是否能在多语言社交媒体文本中检测希望言论方面优于传统分类器?
  • RQ2音译在提升代码混合的印度语言数据集上希望言论检测性能方面有多有效?
  • RQ3对多个微调的Transformer模型进行集成投票是否能增强在泰米尔语和马拉雅拉姆语等低资源语言中的检测性能?
  • RQ4RoBERTa、ALBERT和IndicBERT等不同预训练模型在英语、泰米尔语和马拉雅拉姆语希望言论检测中的表现如何比较?

主要发现

  • 微调的Transformer模型集成在英语中取得了最高的加权F1分数0.93,优于所有其他方法。
  • 在泰米尔语中,使用IndicBERT的集成方法取得了0.75的加权F1分数,在14个系统中排名第八。
  • 在马拉雅拉姆语中,集成模型取得了0.49的加权F1分数,在14个系统中排名第十一位。
  • 第二种方法(微调的Transformer模型与集成投票)在所有三种语言中均持续优于第一种方法(上下文嵌入与传统分类器结合)。
  • 在英语中,RoBERTa-base是表现最佳的单一模型,而IndicBERT在泰米尔语和马拉雅拉姆语中表现最强。
  • 宏平均F1与加权F1之间的差异表明存在类别不平衡问题,特别是在泰米尔语和马拉雅拉姆语中,少数类别的预测准确性较低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。