Skip to main content
QUICK REVIEW

[论文解读] A Large-Scale Database for Graph Representation Learning

Scott Freitas, Yuxiao Dong|arXiv (Cornell University)|Nov 16, 2020
Advanced Graph Neural Networks参考文献 59被引用 14
一句话总结

本文介绍了 MalNet,这是迄今为止最大的公开图数据库,包含120万个恶意软件函数调用图(FCG),平均每张图包含1.5万个节点和3.5万条边,涵盖47种类型和696个家族。该数据集支持大规模图表示学习的评估,揭示了可扩展性挑战,并验证了简单基线方法在前所未有的规模下的有效性。

ABSTRACT

With the rapid emergence of graph representation learning, the construction of new large-scale datasets is necessary to distinguish model capabilities and accurately assess the strengths and weaknesses of each technique. By carefully analyzing existing graph databases, we identify 3 critical components important for advancing the field of graph representation learning: (1) large graphs, (2) many graphs, and (3) class diversity. To date, no single graph database offers all these desired properties. We introduce MalNet, the largest public graph database ever constructed, representing a large-scale ontology of malicious software function call graphs. MalNet contains over 1.2 million graphs, averaging over 15k nodes and 35k edges per graph, across a hierarchy of 47 types and 696 families. Compared to the popular REDDIT-12K database, MalNet offers 105x more graphs, 39x larger graphs on average, and 63x more classes. We provide a detailed analysis of MalNet, discussing its properties and provenance, along with the evaluation of state-of-the-art machine learning and graph neural network techniques. The unprecedented scale and diversity of MalNet offers exciting opportunities to advance the frontiers of graph representation learning--enabling new discoveries and research into imbalanced classification, explainability and the impact of class hardness. The database is publicly available at www.mal-net.org.

研究动机与目标

  • 解决当前图表示学习技术评估中缺乏大规模、多样化且类别丰富的图数据集的问题。
  • 克服现有基准(如 REDDIT-12K)在规模、大小和类别多样性方面不足的局限性。
  • 支持在图表示学习中对类别不平衡、模型可解释性和类别难度的研究。
  • 提供一个公开可用、大规模且多样化的图数据集,作为该领域的新型基准。
  • 促进对最先进图神经网络和表示学习方法在可扩展性和鲁棒性方面的全新洞察发现。

提出的方法

  • 构建 MalNet 作为恶意软件函数调用图(FCG)的大规模本体,其中节点代表函数,边代表过程间调用关系。
  • 利用 Euphony 分类系统,基于 VirusTotal 报告将每个 FCG 分配到包含47种类型和696个家族的分层结构中。
  • 聚合并发布原始的 VirusTotal 报告(每份样本最多70个杀毒软件标签),以保留溯源信息并支持稳健的标注。
  • 以边列表格式存储数据集,总大小超过443 GB,并提供关于图大小、度分布和类别分布的全面描述性统计信息。
  • 在 CC-BY 许可下发布数据集,并在 GitHub 上提供开源代码,以确保可复现性和社区采纳。
  • 利用该数据集在多个评估指标下评估最先进图表示学习模型,包括 GNN 和图核方法。

实验结果

研究问题

  • RQ1在包含120万张图且类别多样性高的数据集上,当前图表示学习模型在大规模场景下的表现如何?
  • RQ2当应用于包含1.5万个以上节点和3.5万条以上边的大图时,现有图神经网络和图核方法在可扩展性方面存在哪些限制?
  • RQ3类别不平衡在图分类任务中如何影响模型性能?在大规模场景下,简单基线方法是否能超越复杂模型?
  • RQ4MalNet 在多大程度上能够支持对模型可解释性和图表示学习中类别难度影响的研究?
  • RQ5MalNet 所具备的前所未有的规模和多样性,是否能够揭示在小型基准中无法观察到的图表示学习新模式或行为?

主要发现

  • MalNet 包含120万张图,其平均节点数和边数是 REDDIT-12K 的39倍,类别数量多出63倍。
  • 该数据集涵盖47种恶意软件类型和696个家族,图的大小从几百个节点和边到超过10万个节点和边不等。
  • 评估结果揭示了最先进 GNN 和图核方法在大规模图上存在显著的可扩展性挑战,尤其是在类别不平衡条件下。
  • 简单的基线方法(如图级别池化或随机特征)在 MalNet 上表现出出人意料的强性能,挑战了对模型复杂度需求的既有假设。
  • 该数据集暴露了固有的类别不平衡问题,部分家族样本数量极少,影响了模型的泛化能力和公平性。
  • MalNet 支持对可解释性和类别难度的新研究,这从模型在多样化且不平衡类别上的行为分析中得到了证实。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。