[论文解读] UM-IU@LING at SemEval-2019 Task 6: Identifying Offensive Tweets Using BERT and SVMs
本论文针对 SemEval-2019 任务6 提出了一种混合方法,用于检测攻击性推文。在子任务 A 中,采用微调后的 BERT 进行二元攻击性内容检测;在子任务 C 中,采用基于字符 n-gram 的线性支持向量机(SVM)对攻击目标进行分类。该系统在子任务 A 上取得 0.8136 的宏平均 F1 分数(共 103 个提交中排名第 3),在子任务 C 上取得 0.5243 的宏平均 F1 分数(共 65 个提交中排名第 27),尽管在捕捉细微语义差异和处理少数目标类别数据稀疏性方面存在挑战,仍表现出强劲性能。
This paper describes the UM-IU@LING's system for the SemEval 2019 Task 6: OffensEval. We take a mixed approach to identify and categorize hate speech in social media. In subtask A, we fine-tuned a BERT based classifier to detect abusive content in tweets, achieving a macro F1 score of 0.8136 on the test data, thus reaching the 3rd rank out of 103 submissions. In subtasks B and C, we used a linear SVM with selected character n-gram features. For subtask C, our system could identify the target of abuse with a macro F1 score of 0.5243, ranking it 27th out of 65 submissions.
研究动机与目标
- 开发一种稳健的计算系统,用于检测社交媒体中的攻击性语言,特别是推文中的仇恨言论。
- 应对在嘈杂、依赖上下文的社交媒体文本中检测攻击性内容的挑战,尤其是细微的语义差异。
- 提升对攻击性语言目标(个人、群体或其他)的识别能力,尤其针对少数类目标的数据稀疏性问题。
- 评估预训练语言模型(如 BERT)与传统分类器(如基于 n-gram 特征的 SVM)在攻击性语言检测任务中的有效性。
- 探究 BERT 在捕捉上下文细微差别方面的局限性,以及在低资源设置下特征工程对 SVM 性能的影响。
提出的方法
- 对 BERT-base 模型进行微调,用于子任务 A 的二元分类,使用全部训练数据检测攻击性与非攻击性推文。
- 在子任务 B 和 C 中采用线性 SVM 与字符 n-gram 特征,因为 BERT 受限于数据稀疏性和超参数敏感性而表现不佳。
- 选择字符 n-gram 作为 SVM 的主要特征,并通过额外实验引入语言学特征、表情符号和实体特征以提升性能。
- 在测试数据上进行超参数调优与模型验证,以在最终提交前选择最优特征配置。
- 采用混合方法:在子任务 A 中使用 BERT 进行上下文敏感的表征学习,在子任务 B 和 C 中使用基于表面特征的 SVM 进行分类。
- 对误分类样本进行错误分析,以识别主要失败模式,特别是在区分个人与群体目标以及处理模糊实体方面。
实验结果
研究问题
- RQ1微调后的 BERT 是否能有效检测社交媒体中的攻击性推文,尤其是在细微语境含义将侮辱与一般负面情绪区分开来的情况下?
- RQ2为何 BERT 在子任务 B 和 C 中的表现劣于子任务 A?数据稀疏性或超参数敏感性等因素是否为主要成因?
- RQ3线性 SVM 搭配字符 n-gram 特征在分类攻击性语言目标(个人、群体、其他)方面,能否显著优于基线模型?
- RQ4表情符号、语言学线索和命名实体等附加特征在子任务 C 中对 SVM 性能有何影响?
- RQ5系统在识别正确目标类别时的主要失败模式是什么,特别是在存在多个潜在目标或模糊指代的情况下?
主要发现
- 基于 BERT 的分类器在子任务 A 上取得 0.8136 的宏平均 F1 分数,位列 103 个提交中的第 3 名,表明其在检测攻击性内容方面表现强劲。
- 基于字符 n-gram 的 SVM 在子任务 C 上取得 0.5243 的宏平均 F1 分数,位列 65 个提交中的第 27 名,显著优于基线模型。
- 系统在识别个人目标(IND)方面表现最佳,对群体目标(GRP)中等有效,而对少数类(OTH)最吃力,表明存在数据稀疏性问题。
- 加入语言学和表情符号特征略微提升了字符 n-gram 模型的宏平均 F1 分数与准确率,但引入实体特征反而导致性能下降。
- 错误分析显示,模型常将包含多个目标或模糊指代的推文误分类,例如当多个个人被侮辱时,或当‘Church’一词触发错误的 OTH 标注。
- 模型对上下文中的攻击性词汇高度敏感,但难以区分攻击意图与一般负面情绪,尤其在文化或政治敏感语境下表现不足。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。