[论文解读] Multilingual Multimodal Digital Deception Detection and Disinformation Spread across Social Platforms
本文提出多语言、多模态模型,用于检测社交媒体平台上的数字欺骗行为,如虚假信息、宣传和谣言,结合文本、图像及跨平台传播模式。二元检测准确率达95%,多语言分类的宏平均F1为0.76,表明联合文本-图像模型优于单模态方法,并揭示了跨语言和平台的欺骗性语言与行为特征。
Our main contribution in this work is novel results of multilingual models that go beyond typical applications of rumor or misinformation detection in English social news content to identify fine-grained classes of digital deception across multiple languages (e.g. Russian, Spanish, etc.). In addition, we present models for multimodal deception detection from images and text and discuss the limitations of image only and text only models. Finally, we elaborate on the ongoing work on measuring deceptive content (in particular disinformation) spread across social platforms.
研究动机与目标
- 开发多语言模型,以检测英语以外的细粒度数字欺骗类别(如宣传、谣言、讽刺)
- 通过结合文本和视觉特征,分析多模态欺骗行为,并与单模态模型对比性能
- 研究可信与欺骗性新闻源在不同人口统计和平台上的用户参与度与传播模式
- 利用统一的信息级联与协同行为框架,衡量跨平台虚假信息传播情况
- 开发如ErrFILTER等工具,用于交互式分析欺骗性内容及其传播行为
提出的方法
- 使用字符级嵌入和基于DeepWalk的网络特征训练多语言文本分类模型,实现多语言表征
- 构建联合多模态模型,通过注意力机制融合文本与视觉特征,以提升欺骗检测性能
- 采用基于来源的标注(非内容级别)标注传播欺骗性内容的意图,支持细粒度分类
- 分析1100万条社交媒体帖子,比较可信与欺骗性新闻源在不同平台上的传播模式
- 在DARPA SocialSim项目框架下,开发统一框架以追踪跨平台虚假信息传播,包括协同用户行为与URL传播
- 开发交互式工具ErrFILTER,用于可视化与分析欺骗性内容及模型行为
实验结果
研究问题
- RQ1在多语言社交媒体内容中,数字欺骗的子类别(如讽刺、宣传、谣言)之间的语言标记有何差异?
- RQ2结合文本与图像特征的多模态模型在欺骗检测中,相较于单模态模型,性能提升程度如何?
- RQ3在不同人口统计和平台中,可信与欺骗性新闻源的用户参与度与传播行为有何差异?
- RQ4虚假信息如何在Twitter、YouTube和Telegram等平台上传播?协同账户与共享URL发挥了何种作用?
- RQ5网络中断对危机事件期间虚假信息传播的影响如何?这些影响又该如何衡量?
主要发现
- 表现最佳的二元检测模型在英语中对多个子类别的欺骗内容识别达到95%准确率和0.91的F1分数
- 结合文本与图像特征的多模态模型在二元分类中取得0.74的F1分数,优于仅使用文本或仅使用图像的模型
- 仅使用文本的模型在F-measure上比仅使用图像的模型高出3%至13%,表明文本在欺骗检测中仍更具信息量
- 在多语言场景下,采用字符级嵌入和DeepWalk特征的模型在四分类与五分类任务中均达到0.76的宏平均F1
- 少数高度活跃用户,尤其是低收入和教育程度较低的人群,对虚假信息传播负有主要责任
- 机器人账户表现出与人类用户不同的参与模式,且对欺骗性内容的反应在Twitter和YouTube等平台间保持一致
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。