Skip to main content
QUICK REVIEW

[论文解读] Learn over Past, Evolve for Future: Forecasting Temporal Trends for Fake News Detection

Beizhe Hu, Qiang Sheng|arXiv (Cornell University)|Jun 26, 2023
Misinformation and Its ImpactsSocial Sciences被引用 3
一句话总结

本文提出 FTT(Forecasting Temporal Trends)——一种新颖的框架,通过建模新闻数据中的主题级时间模式,提升虚假新闻检测在时间上的泛化能力。通过预测未来主题频率并据此重新加权训练样本,FTT 提升了模型在后续数据上的性能,在时间划分的数据集上,对现有主题和新主题均优于基线方法。

ABSTRACT

Fake news detection has been a critical task for maintaining the health of the online news ecosystem. However, very few existing works consider the temporal shift issue caused by the rapidly-evolving nature of news data in practice, resulting in significant performance degradation when training on past data and testing on future data. In this paper, we observe that the appearances of news events on the same topic may display discernible patterns over time, and posit that such patterns can assist in selecting training instances that could make the model adapt better to future data. Specifically, we design an effective framework FTT (Forecasting Temporal Trends), which could forecast the temporal distribution patterns of news data and then guide the detector to fast adapt to future distribution. Experiments on the real-world temporally split dataset demonstrate the superiority of our proposed framework. The code is available at https://github.com/ICTMCG/FTT-ACL23.

研究动机与目标

  • 为解决虚假新闻检测中的关键时间漂移问题,即模型在历史数据上训练后在新数据上性能下降,这是由于新闻分布随时间演变所致。
  • 探究主题级时间模式(如下降、周期性或平稳性)是否能指导更优的未来泛化训练数据选择。
  • 开发一种框架,用于在主题层面预测时间趋势,并利用这些预测结果对训练实例进行重新加权,以提升时间泛化能力。
  • 实现在训练阶段无需访问目标领域数据的情况下,有效适应未见的未来数据。

提出的方法

  • 该框架将训练新闻样本映射到向量空间,并应用聚类以发现潜在主题。
  • 采用可分解的时间序列模型,基于历史序列预测每个主题在未来时间段的频率趋势。
  • 利用预测的趋势动态重新加权训练实例:对预期频率上升的主题分配更高权重,对正在衰减的主题分配更低权重。
  • 重新加权的损失函数用于指导任何基于神经网络的虚假新闻检测器的训练,从而提升其对后续数据分布的泛化能力。
  • 该方法与现有检测器兼容,无需修改网络架构。

实验结果

研究问题

  • RQ1能否有效建模主题级时间模式(如周期性、下降或平稳性),以提升在新数据上的虚假新闻检测性能?
  • RQ2预测未来主题频率对时间漂移设置下虚假新闻检测器的泛化性能有何影响?
  • RQ3基于时间趋势预测的实例重加权在多大程度上可减少在新时间数据上测试时的性能下降?
  • RQ4所提出的框架是否能同时提升对现有主题和未来新出现主题的检测性能?

主要发现

  • 在时间划分的数据集上,FTT 在五种基线方法中表现最优,在新主题上的宏平均 F1 达到 0.8846,在现有主题上达到 0.8843。
  • 该框架在现有主题和新主题上均提升了性能,表明其对未见主题和演化分布具有更强的泛化能力。
  • 案例研究显示,FTT 成功捕捉了上升趋势(如“Big Tech”、“Infectious Diseases”)和复杂模式(如“Medication Safety”中的‘smiling curve’),从而纠正了此前误分类的样本。
  • 统计分析证实,重加权策略有效增强了模型对高频主题的熟悉度,并提升了对新主题的鲁棒性。
  • 模型性能的提升归因于对主题级时间趋势的准确预测,该预测引导了更有效的训练数据加权。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。