Skip to main content
QUICK REVIEW

[论文解读] RF-GNN: Random Forest Boosted Graph Neural Network for Social Bot Detection

Shuhao Shi, Kai Qiao|arXiv (Cornell University)|Apr 14, 2023
Network Security and Intrusion Detection被引用 5
一句话总结

本文提出了一种新型的随机森林增强图神经网络(RF-GNN),用于社交机器人检测。该方法在集成框架中将图神经网络(GNN)作为基分类器,通过节点采样、特征选择和边丢弃构建多样化的子图,并对齐GNN与全连接神经网络(FCN)的输出,从而提升模型的鲁棒性和准确性,在基准数据集上优于当前最先进的GNN基线模型。

ABSTRACT

The presence of a large number of bots on social media leads to adverse effects. Although Random forest algorithm is widely used in bot detection and can significantly enhance the performance of weak classifiers, it cannot utilize the interaction between accounts. This paper proposes a Random Forest boosted Graph Neural Network for social bot detection, called RF-GNN, which employs graph neural networks (GNNs) as the base classifiers to construct a random forest, effectively combining the advantages of ensemble learning and GNNs to improve the accuracy and robustness of the model. Specifically, different subgraphs are constructed as different training sets through node sampling, feature selection, and edge dropout. Then, GNN base classifiers are trained using various subgraphs, and the remaining features are used for training Fully Connected Netural Network (FCN). The outputs of GNN and FCN are aligned in each branch. Finally, the outputs of all branches are aggregated to produce the final result. Moreover, RF-GNN is compatible with various widely-used GNNs for node classification. Extensive experimental results demonstrate that the proposed method obtains better performance than other state-of-the-art methods.

研究动机与目标

  • 解决传统基于特征的机器人检测方法忽略用户交互关系的局限性。
  • 克服独立GNN在对抗性与演化型机器人行为下缺乏鲁棒性的缺陷。
  • 整合集成学习(随机森林)与图神经网络(GNN)的优势,以提升检测性能。
  • 设计一种兼容多种GNN主干网络的灵活框架,适用于节点分类任务。
  • 通过一种新颖的输出对齐机制,有效利用被丢弃的特征,提升模型鲁棒性。

提出的方法

  • 通过在原始社交图上应用节点采样、特征选择和边丢弃,构建多样化的子图用于训练。
  • 在不同子图上训练多个GNN基分类器,并将剩余特征作为全连接神经网络(FCN)的输入。
  • 实现一种输出对齐机制,融合GNN与FCN分支的预测结果,以提升特征利用率。
  • 采用典型的随机森林集成中常见的投票机制,聚合所有分支的预测结果。
  • 通过将GNN架构视为可互换的基分类器,实现与多种GNN模型的兼容性。
  • 利用随机森林的集成特性,降低过拟合风险,并提升对子图变化的鲁棒性。

实验结果

研究问题

  • RQ1在随机森林框架中集成GNN作为基分类器,能否提升社交机器人检测的性能?
  • RQ2通过节点采样、特征选择和边丢弃实现的子图多样性,如何影响模型的鲁棒性与准确性?
  • RQ3所提出的输出对齐机制在利用GNN训练过程中被丢弃的特征方面,能在多大程度上提升性能?
  • RQ4RF-GNN框架是否在多个基准数据集上持续优于当前最先进的基于GNN的基线模型?
  • RQ5在社交机器人检测背景下,该框架在不同GNN架构上的泛化能力如何?

主要发现

  • RF-GNN在多个公开的社交机器人检测基准数据集上,性能优于当前最先进的基于GNN的基线模型。
  • 所提出的输出对齐机制通过有效利用GNN训练过程中被丢弃的特征,显著提升了模型鲁棒性。
  • 通过节点采样、特征选择和边丢弃构建子图,可生成多样化的基分类器,增强集成模型的泛化能力。
  • 该框架与多种广泛使用的GNN模型表现出良好的兼容性,证实了其灵活性与可扩展性。
  • 大量实验表明,RF-GNN在不同数据集与设置下,持续提升了检测准确率与鲁棒性。
  • 源代码、数据与相关成果已公开发布于 https://github.com/GraphDetec/RF-GNN,支持可复现性与进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。