[论文解读] Improving Generalizability of Fake News Detection Methods using Propensity Score Matching
本文提出在虚假新闻检测中使用倾向得分匹配(PSM)进行特征选择,通过减少混淆变量偏差来提升模型的泛化能力。通过用PSM替代传统的基于文档频率的特征选择方法,该方法识别出更具因果相关性的特征,从而在逻辑回归、随机森林和SVM等多种分类器上显著提升跨数据集的性能。
Recently, due to the booming influence of online social networks, detecting fake news is drawing significant attention from both academic communities and general public. In this paper, we consider the existence of confounding variables in the features of fake news and use Propensity Score Matching (PSM) to select generalizable features in order to reduce the effects of the confounding variables. Experimental results show that the generalizability of fake news method is significantly better by using PSM than using raw frequency to select features. We investigate multiple types of fake news methods (classifiers) such as logistic regression, random forests, and support vector machines. We have consistent observations of performance improvement.
研究动机与目标
- 解决虚假新闻语料库中混淆变量导致的特征选择偏差问题,从而降低模型泛化能力。
- 提升虚假新闻检测模型在不同数据分布下的泛化能力,特别是在训练集与测试集分布不一致的情况下。
- 开发一种基于因果推断的特征选择方法,识别与虚假新闻具有更强因果关联的特征,而非仅相关性特征。
- 证明基于PSM的特征选择在多种机器学习模型(包括逻辑回归、随机森林和SVM)上均能持续提升性能。
- 提供一个可复现的研究框架,使用开源数据集(FakeNewsNet)和代码,以支持虚假新闻检测研究中的泛化能力提升。
提出的方法
- 应用倾向得分匹配(PSM)通过建模基于观测协变量的新闻文章为虚假新闻的概率来选择特征。
- 使用逻辑回归估计倾向得分,表示在给定特征条件下文章被标记为虚假的可能性。
- 将倾向得分相近的虚假和真实新闻文章进行匹配,以构建平衡且混淆变量减少的训练集。
- 基于匹配对中特征的稳定性和预测能力选择特征,优先选择在平衡样本中始终与虚假新闻相关联的特征。
- 在多种分类器和数据集上,将基于PSM的特征选择与基于文档频率的基线方法进行对比。
- 使用跨数据集测试的AUROC分数评估模型性能,以衡量其泛化能力。
实验结果
研究问题
- RQ1倾向得分匹配能否提升虚假新闻检测模型在不同数据分布下的泛化能力?
- RQ2与传统的基于文档频率的特征选择相比,基于PSM的特征选择在跨数据集性能上表现如何?
- RQ3PSM与文档频率分别选择哪些类型的特征?它们的泛化特性有何差异?
- RQ4使用PSM是否能生成更稳定且具有因果相关性的特征集合,从而降低对数据集特定偏差的敏感性?
- RQ5基于PSM的特征选择是否能在包括逻辑回归、随机森林和SVM在内的多种机器学习模型上持续提升性能?
主要发现
- 基于PSM的特征选择显著提升了模型的泛化能力,当在PolitiFact上训练并在GossipCop上测试时,AUROC分数从基线的0.56提升至0.68。
- 在PolitiFact数据集上,PSM方法的AUROC达到0.67,优于基线的0.63,表明其在多个数据集上均表现出一致的性能提升。
- PSM选出的顶级特征(如'confirmed'、'inside'、'makes'和'leaves')更具泛化能力,反映了虚假新闻的结构性模式;而文档频率则倾向于选择如'trump'和'obama'等主题特异性术语。
- 当特征集较小时,PSM与基线之间的性能差距最为显著,表明PSM选择的特征更具信息量和稳定性。
- PSM带来的性能提升在多种分类器(包括逻辑回归、随机森林和SVM)上均保持一致,证实了其鲁棒性。
- 实证分析表明,PSM有效降低了数据集特定偏差的影响,因为通过PSM选择的特征对特定语料库中的主导主题依赖性更低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。