Skip to main content
QUICK REVIEW

[论文解读] PDNS-Net: A Large Heterogeneous Graph Benchmark Dataset of Network Resolutions for Graph Learning

Udesh Kumarasinghe, Fatih Deniz|arXiv (Cornell University)|Mar 15, 2022
Advanced Graph Neural Networks被引用 5
一句话总结

PDNS-Net 提供了迄今为止最大规模的公开异构图数据集(447K 个节点,897K 条边),基于被动 DNS 数据用于恶意域名分类,推动了大规模图学习研究。研究发现,异构图神经网络在大规模图上优于同构模型,但性能提升并不一致,凸显了在异构数据上改进模型的必要性。

ABSTRACT

In order to advance the state of the art in graph learning algorithms, it is necessary to construct large real-world datasets. While there are many benchmark datasets for homogeneous graphs, only a few of them are available for heterogeneous graphs. Furthermore, the latter graphs are small in size rendering them insufficient to understand how graph learning algorithms perform in terms of classification metrics and computational resource utilization. We introduce, PDNS-Net, the largest public heterogeneous graph dataset containing 447K nodes and 897K edges for the malicious domain classification task. Compared to the popular heterogeneous datasets IMDB and DBLP, PDNS-Net is 38 and 17 times bigger respectively. We provide a detailed analysis of PDNS-Net including the data collection methodology, heterogeneous graph construction, descriptive statistics and preliminary graph classification performance. The dataset is publicly available at https://github.com/qcri/PDNS-Net. Our preliminary evaluation of both popular homogeneous and heterogeneous graph neural networks on PDNS-Net reveals that further research is required to improve the performance of these models on large heterogeneous graphs.

研究动机与目标

  • 为解决图学习研究中大规模公开异构图数据集稀缺的问题。
  • 从被动 DNS 数据构建一个真实世界的大规模异构图,用于恶意域名分类。
  • 在前所未有的大规模数据集上,支持同构与异构图神经网络的基准测试。
  • 识别大规模异构图上图学习的性能差距与研究挑战。
  • 为不平衡分类、对抗鲁棒性以及可解释性在真实网络图上的研究提供基础。

提出的方法

  • 基于从 VirusTotal 收集的 20,354 个恶意域名和 Farsight Security 提供的被动 DNS 解析数据,构建了 PDNS-Net。
  • 利用 DNS 解析模式构建包含节点类型(域名、IP)和边类型(域名解析到 IP、子域名关系)的异构图。
  • 应用数据采样方法(Leskovec 和 Faloutsos, 2006)生成更小的版本 mPDNS-Net,用于模型评估与可扩展性测试。
  • 使用 PyTorch Geometric (PyG) 实现并训练多种 GNN 变体,包括同构模型(GCN、GraphSAGE、GAT)和异构模型(HGT、HeteroSAGE、HeteroGAT)。
  • 通过合并相同维度的特征并将缺失维度用零填充,将不同类型节点的特征映射到共享嵌入空间。
  • 使用 Adam 优化器(初始学习率 5×10⁻³,权重衰减 1×10⁻³)在 200 个周期内训练模型,采用两层 GNN(每层 64 个隐藏单元)和一个最终的线性分类器。

实验结果

研究问题

  • RQ1在像 PDNS-Net 这样大规模的异构图上,同构与异构 GNN 模型的性能表现如何?
  • RQ2增加图的规模是否能提升同构与异构 GNN 的分类性能?
  • RQ3为何尽管具备良好的可扩展性,同构 GNN 在大规模异构图上仍表现欠佳?
  • RQ4异构 GNN 是否能在大规模真实网络图上显著优于同构模型?
  • RQ5在大规模真实异构图上部署现有 GNN 模型进行网络安全部署时,面临哪些关键挑战?

主要发现

  • PDNS-Net 的规模是 IMDB 的 38 倍,DBLP 的 17 倍,是当前图学习领域最大的公开异构图数据集。
  • 异构 GNN 模型(如 HeteroGAT)在 PDNS-Net 上达到 94% 的 F1 分数和 96% 的 AUC,显著优于同构模型(如 GCN 的 77% F1 和 77% AUC)。
  • 在更大的 PDNS-Net 数据集上,异构模型表现出显著的性能提升,而同构模型则没有,表明存在可扩展性或表征不匹配的问题。
  • HeteroSAGE 和 HeteroGAT 在 PDNS-Net 上分别达到 93% 的准确率和 94% 的 F1 分数,证明了在大规模图上异构消息传递的有效性。
  • 异构模型在更小的 mPDNS-Net 上的性能提升边际较小,表明当前模型尚未针对小规模异构图进行优化。
  • HeteroGAT 在 PDNS-Net 上的误报率(FPR)仅为 6%,表明其在恶意域名检测中具有出色的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。