[论文解读] Evaluating Classifiers in Detecting 419 Scams in Bilingual Cybercriminal Communities
本研究评估了朴素贝叶斯、k-最近邻(IBK)和支持向量机(SVM)在双语尼日利亚网络犯罪论坛中检测419诈骗的性能。基于真实世界数据集,SVM在95%置信水平下显著优于其他分类器,证明其在多语言网络犯罪检测场景中具有更优的有效性。
Incidents of organized cybercrime are rising because of criminals are reaping high financial rewards while incurring low costs to commit crime. As the digital landscape broadens to accommodate more internet-enabled devices and technologies like social media, more cybercriminals who are not native English speakers are invading cyberspace to cash in on quick exploits. In this paper we evaluate the performance of three machine learning classifiers in detecting 419 scams in a bilingual Nigerian cybercriminal community. We use three popular classifiers in text processing namely: Naïve Bayes, k-nearest neighbors (IBK) and Support Vector Machines (SVM). The preliminary results on a real world dataset reveal the SVM significantly outperforms Naïve Bayes and IBK at 95% confidence level.
研究动机与目标
- 评估机器学习分类器在双语网络犯罪群体中检测419诈骗的有效性。
- 评估分类器在尼日利亚网络犯罪论坛真实世界数据集上的表现,该论坛中英语与当地语言并存。
- 比较三种广泛使用的文本分类模型——朴素贝叶斯、IBK和SVM的准确率与鲁棒性。
- 识别在多语言在线犯罪环境中检测诈骗内容最有效的分类器。
提出的方法
- 本研究采用从双语尼日利亚网络犯罪论坛收集的真实世界数据集,其中包含英语和尼日利亚本地语言的文本消息。
- 文本预处理包括分词、停用词移除,以及使用词袋模型进行特征提取。
- 对三种分类器——朴素贝叶斯、k-最近邻(IBK)和支持向量机(SVM)——在数据集上进行训练与评估。
- 性能通过准确率、精确率、召回率和F1分数等标准指标进行衡量,并在95%置信水平下进行显著性检验。
- 评估采用10折交叉验证,以确保结果的稳健性与泛化能力。
实验结果
研究问题
- RQ1在双语网络犯罪群体中,哪种机器学习分类器在检测419诈骗方面表现最佳?
- RQ2朴素贝叶斯、IBK和SVM在多语言诈骗检测任务中的准确率与可靠性如何比较?
- RQ3在95%置信水平下,各类分类器之间是否存在显著的性能差异?
- RQ4传统文本分类器在处理低资源、多语言网络犯罪通信方面效果如何?
主要发现
- 在95%置信水平下,支持向量机(SVM)显著优于朴素贝叶斯和k-最近邻(IBK)在检测419诈骗方面的表现。
- SVM分类器在双语数据集上测试的三种模型中,取得了最高的准确率、精确率、召回率和F1分数。
- 朴素贝叶斯和IBK表现较差,其中IBK在F1分数和整体鲁棒性方面尤其表现不佳。
- 结果表明,SVM更适用于处理多语言网络犯罪论坛中所见的语言多样性与复杂性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。