[论文解读] Utilization of Multinomial Naive Bayes Algorithm and Term Frequency Inverse Document Frequency (TF-IDF Vectorizer) in Checking the Credibility of News Tweet in the Philippines
本研究提出了一种针对菲律宾语新闻推文的新闻可信度检测系统,采用多项式朴素贝叶斯与TF-IDF向量化方法。在真实标注数据上进行训练后,该模型在未见数据上的准确率达到88.98%,尽管F1得分达到89.68%,表明在减少假阳性(将虚假新闻误判为真实)方面仍有改进空间。
The digitalization of news media become a good indicator of progress and signal to more threats. Media disinformation or fake news is one of these threats, and it is necessary to take any action in fighting disinformation. This paper utilizes ground truth-based annotations and TF-IDF as feature extraction for the news articles which is then used as a training data set for Multinomial Naive Bayes. The model has an accuracy of 99.46% in training and 88.98% in predicting unseen data. Tagging fake news as real news is a concerning point on the prediction that is indicated in the F1 score of 89.68%. This could lead to a negative impact. To prevent this to happen it is suggested to further improve the corpus collection, and use an ensemble machine learning to reinforce the prediction
研究动机与目标
- 开发一种可靠的自动化系统,用于检测菲律宾新闻推文中的虚假新闻。
- 应对数字新闻媒体中日益严重的虚假信息威胁,特别是在推特等社交媒体平台上的传播。
- 通过实现对病毒式传播新闻内容的快速可信度评估,提升媒体素养与公众信任。
- 评估TF-IDF特征提取与多项式朴素贝叶斯结合在低资源、多语言新闻可信度检测中的有效性。
提出的方法
- 基于真实标签对新闻推文进行标注,以构建有标注的训练数据集。
- 应用词频-逆文档频率(TF-IDF)向量化方法,将文本内容转换为数值特征。
- 使用标注数据集对TF-IDF编码特征训练多项式朴素贝叶斯分类器。
- 利用标准自然语言处理指标(包括准确率、精确率、召回率和F1得分)在未见测试数据上评估模型性能。
- 分析预测错误,特别是将虚假新闻误判为真实的假阳性情况。
- 建议通过增强语料库和采用集成学习方法作为未来改进方向,以减少误分类。
实验结果
研究问题
- RQ1TF-IDF与多项式朴素贝叶斯的结合在菲律宾语境下对新闻推文可信度分类的有效性如何?
- RQ2该模型在预测未见新闻推文时的准确率和F1得分是多少?
- RQ3为何该模型表现出相对较高的假阳性率(将虚假新闻误判为真实)?
- RQ4在低资源环境下,真实标签标注数据能在多大程度上提升可信度检测模型的性能?
- RQ5哪些方法论上的改进可以减少新闻可信度分类中的假阳性预测?
主要发现
- 模型在训练数据上的准确率达到99.46%,表明其在训练数据上学习效果良好。
- 在未见测试数据上,模型准确率达到88.98%,表现出良好的泛化能力。
- F1得分为89.68%,表明精确率与召回率之间达到中等平衡,但提示存在显著的假阳性风险。
- 高假阳性率是一个关键局限,因为将虚假新闻误判为真实可能带来严重的社会后果。
- 本研究指出,语料质量与模型集成技术是未来减少假阳性问题的关键改进方向。
- 结果验证了在菲律宾等低资源、多语言环境下,使用TF-IDF与多项式朴素贝叶斯进行可信度检测的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。