Skip to main content
QUICK REVIEW

[论文解读] Towards Automatic Detection of Misinformation in Online Medical Videos

Rui Hou, Verónica Pérez‐Rosas|arXiv (Cornell University)|Sep 4, 2019
Misinformation and Its Impacts参考文献 30被引用 9
一句话总结

本文提出一种多模态方法,用于自动检测在线医疗视频中的虚假信息,重点关注来自YouTube的前列腺癌相关内容。通过创建一个包含250个手动标注视频的新数据集,并结合语言、声音和用户参与度特征,作者在分类虚假信息内容方面实现了74%的准确率,显著优于多数类别的基线模型。

ABSTRACT

Recent years have witnessed a significant increase in the online sharing of medical information, with videos representing a large fraction of such online sources. Previous studies have however shown that more than half of the health-related videos on platforms such as YouTube contain misleading information and biases. Hence, it is crucial to build computational tools that can help evaluate the quality of these videos so that users can obtain accurate information to help inform their decisions. In this study, we focus on the automatic detection of misinformation in YouTube videos. We select prostate cancer videos as our entry point to tackle this problem. The contribution of this paper is twofold. First, we introduce a new dataset consisting of 250 videos related to prostate cancer manually annotated for misinformation. Second, we explore the use of linguistic, acoustic, and user engagement features for the development of classification models to identify misinformation. Using a series of ablation experiments, we show that we can build automatic models with accuracies of up to 74%, corresponding to a 76.5% precision and 73.2% recall for misinformative instances.

研究动机与目标

  • 为应对在线医疗视频中虚假信息日益严重的问题,特别是YouTube平台上的虚假信息,这些信息可能误导用户并损害健康结果。
  • 开发计算工具,以自动检测医疗视频中的虚假信息,减少对医学专家人工审核的依赖。
  • 创建一个包含250个前列腺癌相关YouTube视频的全新高质量数据集,这些视频已由医学专家手动标注虚假信息,以支持未来研究。
  • 研究语言、声音和用户参与度特征在区分虚假信息与可信医疗内容方面的有效性。
  • 评估多模态融合策略在提升虚假信息检测准确率方面的表现,超越单一模态方法。

提出的方法

  • 通过有针对性的搜索查询筛选出250个关于前列腺癌的YouTube视频,确保内容类型和演讲者背景的多样性。
  • 由医学专家对每个视频进行虚假信息的逐项标注,根据临床准确性和偏见将视频标记为“可信”或“虚假”。
  • 从视频内容的转录文本中提取语言特征,包括词汇、句法和基于情感的线索,使用自然语言处理技术。
  • 从音频信号中提取声音特征,如语速、音高和能量,以捕捉与虚假信息相关的声音线索。
  • 收集用户参与度特征,如播放量、点赞数、评论数和视频时长,以评估观众响应模式。
  • 使用早期融合策略,将多模态信号整合,对支持向量机(SVMs)在单一和组合特征集上进行训练,以实现分类。

实验结果

研究问题

  • RQ1结合语言、声音和用户参与度特征的多模态方法能否有效检测在线医疗视频中的虚假信息?
  • RQ2在虚假信息检测中,各单一模态(语言、声音、参与度)的表现与多模态融合相比如何?
  • RQ3用户参与度指标的引入在多大程度上提升了对虚假医疗内容的检测能力?
  • RQ4所提出的模型在检测虚假信息方面与多数类别的基线模型相比表现如何?
  • RQ5当前数据收集和标注方法在捕捉多样化虚假信息模式(如动画或配音视频)方面存在哪些局限性?

主要发现

  • 多模态模型实现了74%的分类准确率,与多数类别的基线相比,错误率降低了55%。
  • 该模型在检测虚假视频方面实现了76.5%的精确率和73.2%的召回率,表明对正样本具有较强的识别能力。
  • 仅语言特征就表现出强大的判别能力,能够捕捉到情绪化语言和简化的医学术语等线索。
  • 声音特征也做出了有意义的贡献,较高的音高和更快的语速等语音模式与虚假信息内容相关。
  • 用户参与度特征(如高点赞率)与虚假信息内容相关,表明存在操纵行为的潜在行为信号。
  • 对三种模态进行联合建模的表现优于单一模态模型,证明了多模态融合在虚假信息检测中的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。