[论文解读] Analysing the Extent of Misinformation in Cancer Related Tweets
本文提出一个包含20,137条与癌症相关的推文的数据集,并开发了一种基于注意力机制的BiLSTM-CRF模型,用于检测关于癌症病因和疗法的虚假信息。研究发现,虚假信息的传播范围远超表面可见程度,其中76.19%的疗法相关推文和53.32%的病因相关推文存在误导性内容,并识别出欺骗性、信任问题以及情感化语言等语言特征作为虚假内容的关键指标。
Twitter has become one of the most sought after places to discuss a wide variety of topics, including medically relevant issues such as cancer. This helps spread awareness regarding the various causes, cures and prevention methods of cancer. However, no proper analysis has been performed, which discusses the validity of such claims. In this work, we aim to tackle the misinformation spread in such platforms. We collect and present a dataset regarding tweets which talk specifically about cancer and propose an attention-based deep learning model for automated detection of misinformation along with its spread. We then do a comparative analysis of the linguistic variation in the text corresponding to misinformation and truth. This analysis helps us gather relevant insights on various social aspects related to misinformed tweets.
研究动机与目标
- 通过创建公开可用的癌症相关推文数据集,应对社交媒体上日益严重的健康虚假信息问题,特别是关于癌症的信息。
- 开发自动化方法,识别讨论癌症病因与疗法的医学相关推文。
- 利用深度学习与语言学特征分析,检测并分析推特上癌症相关推文中的虚假信息。
- 探究在推特癌症话语中,区分虚假信息与准确信息的语言与社会特征。
提出的方法
- 使用与病因、疗法及预防相关的关键词,通过Twitter Streaming API在29天内收集了20,137条独特的癌症相关推文。
- 通过移除URL、提及、表情符号,并利用驼峰命名法与启发式规则对哈希标签进行分割,对推文进行预处理。
- 将‘医学相关’推文定义为提及癌症具体病因或疗法的推文,排除隐喻性或非医学用途的使用。
- 提出一种基于注意力机制的BiLSTM-CRF模型,用于序列标注,从医学相关推文中提取实体(病因/疗法)。
- 使用多种NLP词典(LIWC、NRC、Empath)提取251项语言学特征,用于对比真实与虚假推文。
- 通过统计T检验识别虚假推文与真实推文之间显著的语言学差异,并报告关键特征的优势比。
实验结果
研究问题
- RQ1在推特上,关于癌症病因与疗法的虚假信息传播范围有多大?
- RQ2包含虚假信息的推文与包含准确医学信息的推文在语言特征上存在哪些差异?
- RQ3虚假信息的传播范围与虚假推文数量相比有多大?
- RQ4哪些关键词最常与关于癌症病因与疗法的虚假信息相关联?
- RQ5基于注意力机制的BiLSTM-CRF模型在检测癌症相关推文中的虚假信息方面效果如何?
主要发现
- 在相关推文中,53.32%的关于癌症病因的虚假信息传播范围显著高于初始计数,表明存在高度放大效应。
- 对于疗法相关内容,76.19%的推文存在误导,且虚假信息的传播范围远超此类推文数量,表明存在病毒式传播。
- 基于注意力机制的BiLSTM-CRF模型在检测关于癌症病因的虚假信息时F1得分为0.6846,当采用替代检测方法处理疗法相关内容时F1得分为0.7363。
- 虚假信息推文更可能包含欺骗性(优势比1.860)、信任问题(1.884)以及情感化语言,如喜悦(1.287)和粗俗用语(1.920)。
- 真实推文更具有科学性(优势比-3.402)、表达悲伤(-1.103),并包含与恐惧和死亡相关的词汇,表明其语气更偏向临床。
- 含有虚假信息的推文更具吸引力(优势比3.770),且更可能吸引记者关注(1.616),表明媒体放大是其传播的关键因素。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。