Skip to main content
QUICK REVIEW

[论文解读] The 2021 Urdu Fake News Detection Task using Supervised Machine Learning and Feature Combinations

Muhammad Humayoun|arXiv (Cornell University)|Apr 6, 2022
Misinformation and Its Impacts被引用 5
一句话总结

本文提出了一种基于监督学习的乌尔都语虚假新闻检测方法,采用混合n-gram特征(词n-gram与字符n-gram)及语言学预处理。表现最佳的模型为多项式核支持向量机(SVM),结合停用词移除、词形还原与特征选择,F1宏平均得分达到0.6674,优于所有竞赛提交结果,成为2021年乌尔都语虚假新闻检测的新的最先进水平。

ABSTRACT

This paper presents the system description submitted at the FIRE Shared Task: "The 2021 Fake News Detection in the Urdu Language". This challenge aims at automatically identifying Fake news written in Urdu. Our submitted results ranked fifth in the competition. However, after the result declaration of the competition, we managed to attain even better results than the submitted results. The best F1 Macro score achieved by one of our models is 0.6674, higher than the second-best score in the competition. The result is achieved on Support Vector Machines (polynomial kernel degree 1) with stopwords removed, lemmatization applied, and selecting the 20K best features out of 1.557 million features in total (which were produced by Word n-grams n=1,2,3,4 and Char n-grams n=2,3,4,5,6). The code is made available for reproducibility.

研究动机与目标

  • 开发一种有效的监督机器学习系统,用于检测乌尔都语虚假新闻,该语言为低资源语言。
  • 评估各种语言学预处理技术(如停用词移除与词形还原)对乌尔都语虚假新闻检测性能的影响。
  • 确定最大化检测准确率的词n-gram与字符n-gram特征的最佳组合。
  • 在FIRE 2021乌尔都语虚假新闻检测共享任务中实现最先进性能。
  • 通过开源代码提供可复现的系统,以支持未来研究。

提出的方法

  • 系统结合使用词n-gram(n=1至4)与字符n-gram(n=2至6),从乌尔都语文本中提取文本特征。
  • 文本预处理包括停用词移除与词形还原,以减少词汇变体并提升特征质量。
  • 通过贪心方法进行特征选择,从总共155.7万个候选特征中选取最具有信息量的20,000个特征。
  • 采用多项式核(阶数为1)的支持向量机(SVM)作为主要分类器。
  • 使用标准指标(包括F1宏平均得分)对模型进行训练与评估,以衡量其在FIRE 2021共享任务数据集上的性能。
  • 最终模型配置基于交叉验证及多种特征与预处理组合的性能比较进行选择。

实验结果

研究问题

  • RQ1在乌尔都语虚假新闻检测中,词n-gram与字符n-gram的最佳组合是什么?
  • RQ2如停用词移除与词形还原等预处理技术,如何影响乌尔都语监督式虚假新闻检测模型的性能?
  • RQ3在低资源乌尔都语虚假新闻检测背景下,多项式核SVM是否能优于其他分类器?
  • RQ4在FIRE 2021乌尔都语虚假新闻检测基准上,通过监督学习与特征工程可达到的性能上限是多少?
  • RQ5在F1宏平均得分方面,最终模型与共享任务中其他提交结果相比表现如何?

主要发现

  • 表现最佳的模型取得了0.6674的F1宏平均得分,超越了竞赛中第二名的得分。
  • 使用多项式核SVM(阶数为1)并结合词形还原与停用词移除的配置,在所有测试配置中表现最佳。
  • 从155.7万个特征中筛选出20,000个特征,显著提升了模型效率与性能。
  • 同时包含词n-gram(n=1至4)与字符n-gram(n=2至6)对捕捉乌尔都语文本中的语义与形态模式至关重要。
  • 最终模型在FIRE 2021共享任务中优于所有提交结果,确立了乌尔都语虚假新闻检测的新SOTA。
  • 该系统的代码已公开发布,以支持可复现性及低资源自然语言处理的未来研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。