Skip to main content
QUICK REVIEW

[论文解读] Catching Zika Fever: Application of Crowdsourcing and Machine Learning for Tracking Health Misinformation on Twitter

Amira Ghenai, Yelena Mejova|arXiv (Cornell University)|Jul 12, 2017
Misinformation and Its Impacts被引用 5
一句话总结

本文提出了一种混合型流水线,结合专家筛选、众包标注与机器学习方法,以在2016年寨卡病毒爆发期间检测并追踪Twitter上的健康相关虚假信息。通过对超过1300万条推文的分析,该框架识别出突发性谣言模式,并表明自动化分类器能够有效区分携带谣言的推文与澄清性内容,从而实现对虚假信息的及时公共卫生响应。

ABSTRACT

In February 2016, World Health Organization declared the Zika outbreak a Public Health Emergency of International Concern. With developing evidence it can cause birth defects, and the Summer Olympics coming up in the worst affected country, Brazil, the virus caught fire on social media. In this work, use Zika as a case study in building a tool for tracking the misinformation around health concerns on Twitter. We collect more than 13 million tweets -- spanning the initial reports in February 2016 and the Summer Olympics -- regarding the Zika outbreak and track rumors outlined by the World Health Organization and Snopes fact checking website. The tool pipeline, which incorporates health professionals, crowdsourcing, and machine learning, allows us to capture health-related rumors around the world, as well as clarification campaigns by reputable health organizations. In the case of Zika, we discover an extremely bursty behavior of rumor-related topics, and show that, once the questionable topic is detected, it is possible to identify rumor-bearing tweets using automated techniques. Thus, we illustrate insights the proposed tools provide into potentially harmful information on social media, allowing public health researchers and practitioners to respond with a targeted and timely action.

研究动机与目标

  • 开发一种可扩展的多阶段流水线,用于在公共卫生危机期间检测社交媒体上的健康相关谣言。
  • 应对2016年寨卡病毒爆发期间虚假信息在Twitter上迅速传播的问题,该问题威胁了公共卫生传播工作的成效。
  • 整合专家知识、众包标注与机器学习,以提高实时社交媒体流中谣言检测的准确性和可靠性。
  • 通过权威来源提供的真实标签,评估自动化分类在区分谣言推文与澄清性推文方面的有效性。
  • 通过识别虚假信息的起源、传播路径与时序动态,为公共卫生从业者提供可操作的见解,以应对健康紧急事件中的信息失真。

提出的方法

  • 使用Twitter的流媒体API,从2016年2月到里约夏季奥运会期间收集超过1300万条与寨卡病毒相关的推文。
  • 应用基于LDA的主题建模方法,从推文流中发现新兴的与谣言相关的主题。
  • 通过专家主导的信息检索方法,识别并提取与世卫组织(WHO)和Snopes确认的谣言相关联的推文。
  • 利用众包方式,根据内容和上下文将推文标注为“谣言”或“澄清”,以确保高质量的真实标签。
  • 基于众包标注结果训练机器学习分类器(如监督模型),以实现谣言检测的自动化。
  • 对谣言主题进行时序分析,研究其传播模式、起源以及与权威机构的互动关系。

实验结果

研究问题

  • RQ1如何通过结合专家知识、众包与机器学习的混合系统,在公共卫生危机期间有效检测Twitter上的健康相关谣言?
  • RQ2社交媒体上与寨卡病毒相关的谣言主题具有怎样的时序动态与突发性传播模式?
  • RQ3权威卫生组织与主流媒体在澄清谣言与传播虚假信息方面,其角色有何差异?
  • RQ4基于众包标注数据训练的自动化分类器,在真实世界社交媒体数据中多大程度上能准确识别携带谣言的推文?
  • RQ5在线话语中,哪些关键特征可将谣言与真实可靠的公共卫生信息区分开来?

主要发现

  • 研究发现,寨卡病毒相关谣言的传播呈现出高度突发性的模式,讨论量在重大新闻事件或公共卫生公告发布后出现急剧上升。
  • 谣言常由已知的倡导团体传播,或通过幽默、病毒式传播的内容扩散,表明虚假信息传播背后存在多样化的动机。
  • 主流媒体在澄清谣言方面作用有限;相反,世卫组织(WHO)等官方卫生机构在发布澄清信息方面发挥了核心作用。
  • 基于众包标注数据训练的机器学习分类器在区分谣言推文与澄清性推文方面表现出高精度,证明了自动化检测的可行性。
  • 专家筛选与众包标注的整合显著提升了训练数据的质量与可靠性,从而支持了模型的稳健性能。
  • 该流水线成功捕捉到虚假信息的出现与演变过程,为社交媒体上实时监测公共卫生危机提供了可扩展的模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。