[论文解读] Graph Robustness Benchmark: Benchmarking the Adversarial Robustness of Graph Machine Learning
本文提出了图鲁棒性基准(GRB),这是一个可扩展、统一且可复现的框架,用于评估图机器学习(GML)模型的对抗鲁棒性。GRB通过模块化实现、涵盖多个尺度的多样化数据集以及在精细化场景中的统一协议,标准化了攻击与防御的评估,实现了公平、大规模的基准测试和公开排行榜,从而加速鲁棒GML研究。
Adversarial attacks on graphs have posed a major threat to the robustness of graph machine learning (GML) models. Naturally, there is an ever-escalating arms race between attackers and defenders. However, the strategies behind both sides are often not fairly compared under the same and realistic conditions. To bridge this gap, we present the Graph Robustness Benchmark (GRB) with the goal of providing a scalable, unified, modular, and reproducible evaluation for the adversarial robustness of GML models. GRB standardizes the process of attacks and defenses by 1) developing scalable and diverse datasets, 2) modularizing the attack and defense implementations, and 3) unifying the evaluation protocol in refined scenarios. By leveraging the GRB pipeline, the end-users can focus on the development of robust GML models with automated data processing and experimental evaluations. To support open and reproducible research on graph adversarial learning, GRB also hosts public leaderboards across different scenarios. As a starting point, we conduct extensive experiments to benchmark baseline techniques. GRB is open-source and welcomes contributions from the community. Datasets, codes, leaderboards are available at https://cogdl.ai/grb/home.
研究动机与目标
- 解决图机器学习(GML)模型在对抗鲁棒性评估方面缺乏公平、标准化方法的问题。
- 克服现有基准的局限性,包括不切实际的攻击/防御场景、不一致的评估协议以及可扩展性差的问题。
- 提供一个模块化、可复现的框架,使研究人员能够专注于开发鲁棒的GML模型,而无需重复构建评估流程。
- 建立公开排行榜,以追踪研究进展,并推动图对抗学习领域开放、可复现的研究。
- 在一致、可扩展且精细化的设置下,对真实场景——图修改和图注入——实现评估的标准化。
提出的方法
- 设计两种精细化的攻击场景:图修改(边/节点扰动)和图注入(添加恶意节点),并为攻击者和防御者形式化定义其能力。
- 开发可扩展的、以鲁棒性为重点的数据集划分方案,覆盖多种图规模(小、中、大及全规模),以反映不同攻击/防御难度。
- 在GitHub上托管模块化代码框架,支持多种GNN模型、攻击方法和防御机制,并保持一致的接口。
- 统一所有场景的评估协议,包括标准化指标(准确率、3分钟准确率、加权准确率)和实验设置。
- 集成自动化数据处理与评估流水线,以简化可复现的实验流程。
- 托管持续更新的公开排行榜,用于追踪不同攻击/防御配置和数据集下的性能表现。
实验结果
研究问题
- RQ1在图机器学习中,现有GNN模型和防御方法在标准化、真实的对抗攻击场景下表现如何?
- RQ2模型规模和图大小对对抗鲁棒性的影响如何?不同攻击类型下该影响有何差异?
- RQ3当前防御机制在黑盒、归纳式及规避攻击设置下的性能保持程度如何?
- RQ4GRB中的统一评估协议如何实现对不同GNN架构、攻击方法和防御机制之间公平且可复现的比较?
- RQ5基于公开排行榜的基准测试结果,关于GML对抗鲁棒性的最先进水平可得出哪些见解?
主要发现
- GRB通过标准化数据集、划分方案和评估指标,实现了对多样化GNN模型、攻击与防御方法的一致且公平的评估。
- 基线模型在对抗攻击下表现出显著的性能下降——例如,在H-scale数据集上,FGSM攻击下平均准确率从干净数据的75.84%下降至72.14%。
- 3分钟准确率指标揭示了攻击下的更快性能退化,H-scale数据集在FGSM攻击下平均性能下降至71.93%,表明在时间受限推理下存在脆弱性。
- 加权准确率在强攻击下表现出最严重的退化,F-scale数据集在FGSM攻击下性能下降至60.54%,凸显了对类别不平衡的敏感性。
- 采用鲁棒性训练技术的模型(如RobustGCN、ProGNN)表现出更强的抗性,在攻击下保持了更高的准确率,优于标准GNN。
- 公开排行榜表明,鲁棒性高度依赖于攻击场景和模型架构,尚无单一方法在所有设置中占据主导地位。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。