Skip to main content
QUICK REVIEW

[论文解读] RumourEval 2019: Determining Rumour Veracity and Support for Rumours

Genevieve Gorrell, Kalina Bontcheva|arXiv (Cornell University)|Sep 18, 2018
Misinformation and Its Impacts参考文献 14被引用 17
一句话总结

RumourEval 2019 提出了一项共享任务,通过在2017年基准基础上扩展来自 Reddit 和 Twitter 的多语言数据,并引入统一的立场分类与真实性分类任务,以推动自动化谣言验证的发展。该任务强调改进立场检测以支持真实性预测,采用宏平均 F1 和均方根误差(RMSE)作为评估指标,并提供了最先进基线模型,以促进多模态、多语言谣言分析领域的创新。

ABSTRACT

This is the proposal for RumourEval-2019, which will run in early 2019 as part of that year's SemEval event. Since the first RumourEval shared task in 2017, interest in automated claim validation has greatly increased, as the dangers of "fake news" have become a mainstream concern. Yet automated support for rumour checking remains in its infancy. For this reason, it is important that a shared task in this area continues to provide a focus for effort, which is likely to increase. We therefore propose a continuation in which the veracity of further rumours is determined, and as previously, supportive of this goal, tweets discussing them are classified according to the stance they take regarding the rumour. Scope is extended compared with the first RumourEval, in that the dataset is substantially expanded to include Reddit as well as Twitter data, and additional languages are also included.

研究动机与目标

  • 通过推进自动化谣言验证系统,应对社交媒体中虚假新闻和错误信息日益增长的挑战。
  • 通过整合 Reddit 数据和新语言(俄语和丹麦语)扩展2017年 RumourEval 共享任务,以提升数据集的多样性与真实性。
  • 将子任务 A(立场分类)与子任务 B(真实性预测)统一为单一任务,以鼓励利用立场信息提升真实性检测的系统。
  • 通过允许参与者将立场输出整合到真实性预测模型中,促进信息利用方面的创新。
  • 通过在 Twitter 和 Reddit 数据政策框架下发布经过筛选的数据集,并建立处理已删除内容的机制,支持开放、可复现的研究。

提出的方法

  • 收集并标注来自 Twitter 和 Reddit 的原始推文及讨论线程,重点关注带有真实性标签(真实/虚假/未验证)的谣言。
  • 将用户回应分类为四种类别:支持、否认、质疑和评论,评估时重点关注前三种类别。
  • 使用宏平均 F1 评分评估立场分类,排除“评论”类别以优先关注信息量丰富的回应。
  • 通过微平均准确率和置信度分数的均方根误差(RMSE)评估真实性预测。
  • 为立场和真实性任务提供基于 RumourEval 2017 最优模型的最先进基线,包括深度学习和集成模型。
  • 通过检查已删除推文并遵守 Twitter 开发者政策,确保数据完整性,并在需要时建立数据集更新机制。

实验结果

研究问题

  • RQ1立场分类(支持/否认/质疑)在多大程度上能提升谣言真实性预测的准确性?
  • RQ2Reddit 数据及多语言内容(俄语、丹麦语)的引入如何影响模型在谣言检测中的泛化能力与性能表现?
  • RQ3将立场与真实性预测整合为统一任务的设计,能否催生更高效且更具创新性的系统架构?
  • RQ4不同机器学习与深度学习模型在多语言、多平台数据上的谣言验证任务中表现如何?
  • RQ5置信度分数校准(通过 RMSE 衡量)对自动化谣言核查系统实际部署有何影响?

主要发现

  • 2019 年 RumourEval 共享任务将数据集扩展至包含 Reddit 和多语言内容(俄语和丹麦语),显著提升了数据多样性与真实性。
  • 立场分类性能通过在支持、否认和质疑类别上的宏平均 F1 评分进行评估,排除“评论”类别以优先关注信息丰富的回应。
  • 真实性预测通过微平均准确率和置信度分数的 RMSE 进行评估,实现了二分类与细粒度性能评估的结合。
  • 基线系统基于 RumourEval 2017 的最优模型构建,包括 LSTM 和 CNN 架构,以支持方法论创新。
  • 任务设计鼓励将立场输出整合到真实性模型中,反映了真实世界工作流中立场信号用于判断真实性的实际应用。
  • 实施了数据治理协议以尊重 Twitter 开发者政策,包括检查已删除推文,并建立了数据集更新机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。