[论文解读] Ginger Cannot Cure Cancer: Battling Fake Health News with a Comprehensive Data Repository
本论文介绍了FakeHealth,这是首个全面且公开可用的虚假健康新闻数据集,包含丰富标注的新闻内容、详细的审核说明、社交媒体互动数据以及用户网络信息。该数据集支持可解释性与知识增强的虚假健康信息检测,并通过探索性分析验证了数据集质量,揭示了该领域中的关键挑战。
Nowadays, Internet is a primary source of attaining health information. Massive fake health news which is spreading over the Internet, has become a severe threat to public health. Numerous studies and research works have been done in fake news detection domain, however, few of them are designed to cope with the challenges in health news. For instance, the development of explainable is required for fake health news detection. To mitigate these problems, we construct a comprehensive repository, FakeHealth, which includes news contents with rich features, news reviews with detailed explanations, social engagements and a user-user social network. Moreover, exploratory analyses are conducted to understand the characteristics of the datasets, analyze useful patterns and validate the quality of the datasets for health fake news detection. We also discuss the novel and potential future research directions for the health fake news detection.
研究动机与目标
- 填补虚假健康新闻检测领域中全面、多维度数据集的关键空白。
- 提供一个丰富且经过标注的数据集,以支持可解释性与基于知识的检测方法。
- 使研究人员能够研究虚假健康信息传播中的传播模式与用户行为。
- 通过利用多样化数据源,促进开发稳健且可解释的虚假健康新闻检测模型。
- 通过发布高质量、可扩展且符合隐私合规要求的数据集,支持未来在健康虚假信息领域的研究。
提出的方法
- 构建了两个数据集——HealthStory与HealthRelease,包含带有来源出版商、图片和元数据的新闻内容。
- 从Twitter收集并结构化了50万条推文、2.9万条回复、1.4万条转发以及2.7万个用户资料(含时间线和好友列表)。
- 使用十项标准化评估标准(C1–C8,S9–S10,R9–R10)对每则新闻条目进行详细审核说明标注,以评估其可信度与偏见。
- 通过仅存储社交媒体互动与用户网络的ID来保护用户隐私,同时通过Twitter公开API提供对完整数据的API访问。
- 将数据组织为四个主要文件夹:contents、reviews、engagements和user_network,每个文件夹均包含结构化JSON文件,支持程序化访问。
- 通过版本控制数据仓库并持续维护,确保研究的可复现性与可扩展性。
实验结果
研究问题
- RQ1虚假健康新闻在社交媒体上的关键特征与传播模式是什么?
- RQ2社交媒体用户如何与真实与虚假健康新闻互动?机器人与普通用户各自扮演什么角色?
- RQ3新闻审核说明中的哪些评估标准最能区分虚假与真实健康新闻?
- RQ4能否利用标注的审核标准与社交语境,有效训练可解释的检测模型?
- RQ5从审核说明中提取的知识图谱如何提升虚假新闻检测的可解释性与准确性?
主要发现
- FakeHealth数据集包含50万条推文、2.9万条回复、1.4万条转发以及2.7万个含时间线与好友列表的用户资料,支持大规模社交网络分析。
- 新闻审核说明涵盖十项评估标准,包括证据质量、利益冲突披露与煽动性语言等,为可解释性检测提供了基础。
- 探索性分析显示,普通用户与机器人均参与虚假与真实健康新闻的传播,且传播模式存在显著差异。
- 该数据集支持利用出版商可信度、视觉内容与社交语境的检测模型,其性能超越纯文本方法。
- 结构化审核标注的引入使得模型能够识别健康新闻中的具体缺陷,如风险误报或缺乏资金披露。
- 数据集的设计支持未来基于知识的检测研究,通过从审核说明中提取背景知识,构建可解释的健康知识图谱。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。