[论文解读] Online Disinformation and the Role of Wikipedia
本文通过文献综述识别了在维基百科上应对在线虚假信息的可行策略,重点将虚假信息定义为有意图的、非偶然的错误信息。文章分析了协调性攻击团体和机器人等传播机制,并评估了当前的防御措施——主要是人工巡查和社区管理——同时倡导采用先进的机器学习工具来检测协调性攻击并评估来源可信度,特别是在资源匮乏的语言版本中。
The aim of this study is to find key areas of research that can be useful to fight against disinformation on Wikipedia. To address this problem we perform a literature review trying to answer three main questions: (i) What is disinformation? (ii) What are the most popular mechanisms to spread online disinformation? and (iii) Which are the mechanisms that are currently being used to fight against disinformation?. In all these three questions we take first a general approach, considering studies from different areas such as journalism and communications, sociology, philosophy, information and political sciences. And comparing those studies with the current situation on the Wikipedia ecosystem. We conclude that in order to keep Wikipedia as free as possible from disinformation, it is necessary to help patrollers to early detect disinformation and assess the credibility of external sources. More research is needed to develop tools that use state-of-the-art machine learning techniques to detect potentially dangerous content, empowering patrollers to deal with attacks that are becoming more complex and sophisticated.
研究动机与目标
- 以一种能将虚假信息与其他形式的错误信息区分开的方式来定义虚假信息,尤其强调其欺骗意图。
- 分析在线传播虚假信息的主要机制,包括协调性在线团体、机器人和假身份账号。
- 评估现有应对虚假信息的方法,特别是维基百科上的手动事实核查和社区管理。
- 识别当前防御措施中的漏洞,特别是缺乏可扩展的、基于人工智能的工具来检测协调性虚假信息传播活动。
- 提出利用最先进机器学习技术的研究方向,以支持巡查员并改善来源可信度评估,特别是在较小或资源匮乏的维基百科社区中。
提出的方法
- 在新闻学、社会学、哲学、政治科学和计算机科学等多个学科领域开展文献综述,以定义虚假信息并分析其传播机制。
- 将一般性虚假信息定义与维基百科的中立观点(NPOV)和可验证性等核心质量控制政策进行对比。
- 绘制虚假信息传播机制图谱,包括协调性团体、机器人网络、点击农场和假身份账号,重点关注其对资源匮乏的维基百科社区的影响。
- 评估现有的虚假信息应对措施,包括社区巡查员的手动事实核查、反破坏机器人以及 ORES 等自动化质量评估工具。
- 评估维基百科在作为虚假信息攻击目标的同时,也作为自动化事实核查系统(如 YouTube 和 Facebook 使用的系统)的可靠基准参考的双重角色,特别是在 Wikidata 和实体链接流程中。
- 提出整合先进机器学习技术(如外部来源可信度评分和政治倾向检测)以支持人工巡查员,并实现对大规模协调性攻击的检测。
实验结果
研究问题
- RQ1如何以一种能将虚假信息与其他形式的错误信息区分开的方式来定义虚假信息,特别是从意图角度?
- RQ2在线传播虚假信息的最普遍机制是什么?它们如何具体针对维基百科及其社区?
- RQ3目前用于检测和应对维基百科虚假信息的机制有哪些?它们在可扩展性和有效性方面存在哪些局限?
- RQ4机器学习技术如何被调整以支持维基百科巡查员检测协调性虚假信息传播活动,特别是在资源匮乏的语言版本中?
- RQ5维基数据和维基百科在多大程度上可作为自动化事实核查系统的可靠基准参考?在遭受攻击时依赖它们存在哪些风险?
主要发现
- 虚假信息最合适的定义是:非偶然性地误导性信息,其意图在于制造错误信念,从而与无意的错误信息区分开来。
- 传播虚假信息的最常见机制包括协调性在线团体、机器人网络以及假身份账号的使用,其中资源匮乏的维基百科社区尤其容易受到攻击。
- 目前维基百科的虚假信息防御严重依赖人工巡查和社区管理,尽管其潜在价值显著,但自动化机器学习工具的整合仍有限。
- 维基百科和 Wikidata 具有双重角色:既是虚假信息攻击的目标,也是 YouTube 和 Facebook 等平台所使用的自动化事实核查系统的重要可信基准参考。
- 迫切需要开展研究,开发可扩展的、基于人工智能的工具,以检测跨用户和多语言的协调性攻击,特别是在较小或资源匮乏的维基百科版本中。
- 目前在维基百科上应用的机器学习技术(如 ORES)尚未被充分使用,且主要聚焦于单个编辑行为,而非系统性、协调性的攻击活动。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。