Skip to main content
QUICK REVIEW

[论文解读] Identifying Disinformation Websites Using Infrastructure Features

Austin Hounsel, Jordan Holland|arXiv (Cornell University)|Feb 28, 2020
Misinformation and Its Impacts参考文献 49被引用 11
一句话总结

本文介绍了 Disinfotron,一种可扩展、自动化的系统,通过结合可解释的机器学习方法,利用非感知的基础设施特征(如域名注册模式、SSL 证书属性和托管配置)主动识别虚假信息网站。该系统显著优于以往工作,并首次实现了机器学习支持的虚假信息检测的实时成功部署,支持早期人工审核和浏览器端警告。

ABSTRACT

Platforms have struggled to keep pace with the spread of disinformation. Current responses like user reports, manual analysis, and third-party fact checking are slow and difficult to scale, and as a result, disinformation can spread unchecked for some time after being created. Automation is essential for enabling platforms to respond rapidly to disinformation. In this work, we explore a new direction for automated detection of disinformation websites: infrastructure features. Our hypothesis is that while disinformation websites may be perceptually similar to authentic news websites, there may also be significant non-perceptual differences in the domain registrations, TLS/SSL certificates, and web hosting configurations. Infrastructure features are particularly valuable for detecting disinformation websites because they are available before content goes live and reaches readers, enabling early detection. We demonstrate the feasibility of our approach on a large corpus of labeled website snapshots. We also present results from a preliminary real-time deployment, successfully discovering disinformation websites while highlighting unexplored challenges for automated disinformation detection.

研究动机与目标

  • 为应对在线虚假信息日益增长的威胁,该威胁破坏了民主话语,且难以通过耗时的手动事实核查流程加以应对。
  • 开发一种可扩展、自动化的系统,比当前方法更早地检测虚假信息网站,以缩短其生命周期中的发现时间。
  • 利用基础设施层面的特征(如域名注册、SSL 证书和托管模式)来区分虚假信息网站与合法新闻网站。
  • 通过提供可解释的、机器生成的信号,支持人工审核员识别非感知的警示信号。
  • 通过实时试点部署和概念验证浏览器扩展,证明该系统的实际可行性。

提出的方法

  • Disinfotron 从网站中提取静态基础设施特征,包括域名注册时间、SSL 证书属性和托管提供商特征。
  • 采用多标签分类方法,通过监督式机器学习将网站标记为虚假信息、新闻或其他类别,重点关注对人工审核的可解释性。
  • 系统随时间推移不断演化,随着网站生命周期中数据的积累(从初始设置到实际运行)持续优化预测结果。
  • 特征工程基于恶意基础设施中的已知模式,借鉴了垃圾信息、网络钓鱼和恶意软件检测领域的先前研究。
  • 模型在大规模手动标注的虚假信息和新闻网站数据集上进行训练,基础设施元数据已存档以确保可复现性。
  • 浏览器扩展原型利用实时预测,在用户访问疑似虚假信息网站前发出警告。

实验结果

研究问题

  • RQ1在网站尚未获得显著流量之前,基础设施层面的特征能否可靠地区分虚假信息网站与合法新闻网站?
  • RQ2基于基础设施特征的自动化检测方法在历史数据上的性能与以往最先进方法相比如何?
  • RQ3此类系统能否在实际中实时部署,以支持早期人工审核?
  • RQ4可解释的机器学习特征在多大程度上可协助人工审核员识别虚假信息?
  • RQ5基于基础设施的检测能否在面向消费者的应用工具(如网页浏览器扩展)中实现?

主要发现

  • Disinfotron 在历史数据上检测虚假信息网站方面显著优于以往最先进方法,展现出更高的准确率和可扩展性。
  • 该系统即使在网站生命周期的早期阶段也表现出高性能,支持在广泛传播前实现主动检测。
  • 首次成功开展了基于机器学习的虚假信息发现的实时评估,证明了其在实际部署中的可行性和有效性。
  • 系统的可解释性使人工审核员能够基于域名、证书和托管特征中的技术异常,理解并验证预测结果。
  • 概念验证浏览器扩展成功实现实时警告用户访问虚假信息网站,展示了实际部署的潜力。
  • 作者发布了目前最大的公开数据集,包含手动标注的虚假信息和新闻网站,并附带完整的基础设施元数据,为未来研究提供支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。