[论文解读] Vietnamese Hate and Offensive Detection using PhoBERT-CNN and Social Media Streaming Data
本文提出了一种结合增强数据预处理与EDA技术的PhoBERT-CNN模型,用于越南语仇恨言论及攻击性评论检测,在ViHSD数据集上取得67.46%的F1分数,在HSD-VLSP数据集上达到98.45%,并通过Apache Spark Structured Streaming实现实时流式处理,适用于社交媒体平台的实际部署。
Society needs to develop a system to detect hate and offense to build a healthy and safe environment. However, current research in this field still faces four major shortcomings, including deficient pre-processing techniques, indifference to data imbalance issues, modest performance models, and lacking practical applications. This paper focused on developing an intelligent system capable of addressing these shortcomings. Firstly, we proposed an efficient pre-processing technique to clean comments collected from Vietnamese social media. Secondly, a novel hate speech detection (HSD) model, which is the combination of a pre-trained PhoBERT model and a Text-CNN model, was proposed for solving tasks in Vietnamese. Thirdly, EDA techniques are applied to deal with imbalanced data to improve the performance of classification models. Besides, various experiments were conducted as baselines to compare and investigate the proposed model's performance against state-of-the-art methods. The experiment results show that the proposed PhoBERT-CNN model outperforms SOTA methods and achieves an F1-score of 67,46% and 98,45% on two benchmark datasets, ViHSD and HSD-VLSP, respectively. Finally, we also built a streaming HSD application to demonstrate the practicality of our proposed system.
研究动机与目标
- 解决越南语社交媒体文本在仇恨言论检测中缺乏有效预处理技术的问题。
- 通过使用EDA进行有效数据增强,克服越南语仇恨言论数据集中存在的数据不平衡问题。
- 开发一种高性能、端到端的越南语仇恨言论检测模型,优于现有基线模型。
- 利用Apache Spark实现实时流式仇恨言论检测系统,实现社交媒体平台的实际部署。
- 为构建越南语数字空间更安全的在线环境,贡献一种稳健且可扩展的解决方案。
提出的方法
- 提出一种两阶段预处理管道,以清理越南语社交媒体评论,提升数据质量与模型输入效果。
- 将PhoBERT(一种针对越南语的预训练多语言Transformer)与Text-CNN结合,实现分层特征提取与分类。
- 应用EDA(数据增强)技术,对不平衡数据集中少数类进行数据增强,提升模型泛化能力。
- 在两个基准数据集ViHSD与HSD-VLSP上训练并评估PhoBERT-CNN模型,使用F1分数与准确率作为评估指标。
- 基于Apache Spark Structured Streaming 3.1.1构建实时仇恨言论检测系统,实现低延迟处理,平均每条评论响应时间为1.56秒。
- 使用YouTube Data API流式获取实时评论,由三位经验丰富的越南语NLP标注员进行标注,Cohen’s Kappa系数为0.64。
实验结果
研究问题
- RQ1微调后的PhoBERT-CNN模型是否在越南语仇恨言论检测上优于现有SOTA方法?
- RQ2增强的预处理与EDA技术在不平衡越南语仇恨言论数据集上对模型性能的提升程度如何?
- RQ3基于Apache Spark的实时流式系统是否能有效分类实时社交媒体数据中的仇恨与攻击性评论?
- RQ4所提出的系统在来自YouTube的真实流式评论数据上表现如何?其延迟与准确率如何?
- RQ5上下文感知预处理对低资源越南语NLP环境下仇恨言论检测模型的鲁棒性与泛化能力有何影响?
主要发现
- 所提出的PhoBERT-CNN模型在ViHSD数据集上取得67.46%的F1分数,优于基线模型与先前SOTA方法。
- 在HSD-VLSP数据集上,模型达到98.45%的高F1分数,表明其在更平衡且高质量基准上的优异表现。
- 预处理管道使PhoBERT-CNN模型在ViHSD上的宏平均F1分数提升4.80%,在HSD-VLSP上提升9.70%,证明其有效性。
- 基线模型也从预处理中受益,ViHSD与HSD-VLSP上的平均F1分数分别提升3.58%与10.16%。
- 实时流式系统在500条实时YouTube评论上实现58.19%的宏平均F1分数与82.02%的准确率,平均响应时间为1.56秒。
- 系统通过Apache Spark Structured Streaming实现低延迟处理,达到亚秒级响应时间,连续处理延迟为1ms。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。