Skip to main content
QUICK REVIEW

[论文解读] Towards Automatic Bot Detection in Twitter for Health-related Tasks

Anahita Davoudi, Ari Z Klein|PubMed|Sep 29, 2019
Spam and Phishing Detection参考文献 27被引用 5
一句话总结

该论文提出了一种针对健康相关Twitter数据的增强型机器人账号检测系统,通过在Botometer基础上引入领域特定特征和梯度提升分类器,实现了在与怀孕相关的用户群体中识别非人类账号的F1得分0.700,显著优于原始系统的0.361得分。

ABSTRACT

With the increasing use of social media data for health-related research, the credibility of the information from this source has been questioned as the posts may not from originating personal accounts. While automatic bot detection approaches have been proposed, none have been evaluated on users posting health-related information. In this paper, we extend an existing bot detection system and customize it for health-related research. Using a dataset of Twitter users, we first show that the system, which was designed for political bot detection, underperforms when applied to health-related Twitter users. We then incorporate additional features and a statistical machine learning classifier to improve bot detection performance significantly. Our approach obtains F1-scores of 0.7 for the "bot" class, representing improvements of 0.339. Our approach is customizable and generalizable for bot detection in other health-related social media cohorts.

研究动机与目标

  • 评估现有政治机器人检测系统Botometer在健康相关Twitter用户数据上的表现。
  • 解决通用型机器人检测工具在健康语境下表现不佳的问题,原因在于用户行为和内容模式的差异。
  • 通过引入领域特定特征和机器学习分类器,提升健康相关社交媒体中的机器人检测准确性。
  • 构建一个可定制且可推广的框架,用于健康导向社交媒体研究中的机器人检测。
  • 提供公开可获取的训练数据集和分类代码,以支持可复现性及未来在健康相关机器人检测领域的研究。

提出的方法

  • 收集了10,417名在Twitter上公开宣布怀孕的用户数据,由两名专业标注员手动标注为“机器人”、“非机器人”或“不可用”,标注员间一致性较高(kappa = 0.93)。
  • 保留了8,262名被标注为“机器人”或“非机器人”的用户用于训练和测试,采用分层80/20划分以保持类别分布。
  • 在Botometer原有特征基础上,新增领域特定特征:头像中人脸检测、用户名中姓名存在性,以及基于推文内容的特征,如情感分析和语言复杂度。
  • 使用Botometer得分与新提取的特征联合训练梯度提升(GB)分类器,以提升检测性能。
  • 在保留的1,652名用户的测试集上评估模型,报告各类别的精确率、召回率和F1得分。
  • 使用Cohen’s kappa评估标注员间一致性,确保标注可靠性。

实验结果

研究问题

  • RQ1当应用于健康相关Twitter用户数据时,通用型政治机器人检测系统(Botometer)表现如何?
  • RQ2哪些与健康相关社交媒体行为相关的特定特征可提升机器人检测性能?
  • RQ3在结合Botometer得分与领域特定特征的基础上,训练的机器学习分类器是否能显著提升健康语境下机器人检测的F1得分?
  • RQ4在分类健康相关机器人时,主要挑战是什么,特别是针对代表组织或支持团体的账号?
  • RQ5所提出的方法在多大程度上可推广并针对其他健康相关社交媒体群体进行定制?

主要发现

  • 原始Botometer系统在应用于健康相关Twitter数据时,对“机器人”类别的F1得分为0.361,表明其从政治语境向健康语境的泛化能力较差。
  • 增加领域特定特征——包括头像中人脸检测、用户名中姓名存在性,以及基于内容的语言特征——显著提升了检测性能。
  • 最终采用Botometer得分与扩展特征的梯度提升分类器,对“机器人”类别的F1得分为0.700,相比基线提升了0.339。
  • 该模型对“机器人”类别的精确率达到0.985,召回率为0.724,表明在可靠识别真实机器人的同时,也捕获了相当比例的机器人。
  • 误检为负例(假阴性)的主要原因在于“机器人”的宽泛定义包含了合法的健康组织、论坛和支持团体,其内容由人工维护。
  • 本研究提供了公开可获取的训练数据集和代码,支持研究的可复现性,并为未来在健康相关社交媒体研究中扩展该方法提供了基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。