[论文解读] PyTorch Geometric Signed Directed: A Software Package on Graph Neural Networks for Signed and Directed Graphs
PyTorch Geometric Signed Directed (PyGSD) 是首个专为有向符号图设计的开源深度学习库。它扩展了 PyTorch Geometric,提供针对有向符号图定制的 GNN 模型、数据加载器、损失函数和评估指标,在真实和合成的有向符号网络上的节点分类、链接预测和方向预测任务中,展现出更高的效率和性能。
Networks are ubiquitous in many real-world applications (e.g., social networks encoding trust/distrust relationships, correlation networks arising from time series data). While many networks are signed or directed, or both, there is a lack of unified software packages on graph neural networks (GNNs) specially designed for signed and directed networks. In this paper, we present PyTorch Geometric Signed Directed (PyGSD), a software package which fills this gap. Along the way, we evaluate the implemented methods with experiments with a view to providing insights into which method to choose for a given task. The deep learning framework consists of easy-to-use GNN models, synthetic and real-world data, as well as task-specific evaluation metrics and loss functions for signed and directed networks. As an extension library for PyG, our proposed software is maintained with open-source releases, detailed documentation, continuous integration, unit tests and code coverage checks. The GitHub repository of the library is https://github.com/SherylHYX/pytorch_geometric_signed_directed.
研究动机与目标
- 解决目前缺乏统一、开源的图神经网络(GNN)软件,专门针对有向符号图的问题。
- 提供一个全面、可维护且高效的软件包,支持有向符号图的 GNN 模型、数据生成和任务特定评估。
- 评估并比较现有 GNN 方法在有向符号图上的表现,为实践者提供模型选择指导。
- 扩展 PyTorch Geometric,增加针对有向符号图学习的专用组件,包括自定义损失函数和评估指标。
- 通过开源发布、文档、持续集成、单元测试和代码覆盖率检查,确保软件质量。
提出的方法
- 该库实现了多种专用 GNN 架构,如 DGCN、DiGCN、DiGCNIB、DiGCL、MagNet、SGCN、SNEA、SiGAT、SDGNN、SSSNET 和 MSGNN,均针对有向符号边权重进行了适配。
- 引入了针对节点分类、链接预测(包括三分类和存在性预测)以及有向符号图方向预测的任务专用损失函数和评估指标。
- 集成了合成数据生成器和真实世界数据加载器,用于基准测试,包括 CoraML、CiteSeer、Telegram、BitCoin-Alpha、BitCoin-OTC、Slashdot、Epinions 和 FiLL 等数据集。
- 利用 PyTorch Geometric 的 MessagePassing 框架,通过优化实现提升效率,包括重新实现的 MagNet,其运行时间相比原始实现最高减少 70%。
- 软件采用严格的软件工程实践构建:开源发布、详细文档、持续集成、单元测试和代码覆盖率检查。
- 实验采用标准划分(20% 测试边)和原始论文中的默认超参数,性能通过准确率和运行时间在多个数据集和任务上进行衡量。
实验结果
研究问题
- RQ1哪些 GNN 架构在有向符号图的节点分类任务中表现最佳?
- RQ2不同 GNN 模型在涉及有向符号边的链接预测任务中表现如何比较?
- RQ3PyGSD 实现的计算效率与原始代码库相比如何?
- RQ4专用损失函数和评估指标在有向符号图学习任务中如何提升性能?
- RQ5在真实世界的有向符号网络中,哪种模型架构在准确率与推理速度之间提供了最佳平衡?
主要发现
- 与原始实现相比,PyGSD 将 MagNet 的运行时间减少了高达 70%;在 Cornell 数据集上,我们的优化版本节点分类仅需 21 秒,而原始实现需 73 秒。
- DiGCN 和 DiGCNIB 在大多数数据集上实现了最快的推理速度,其在 Cornell、Texas 和 Wisconsin 数据集上的节点分类任务每折运行时间均低于 10 秒。
- 在 FiLL 数据集(42 个网络)的链接预测任务中,SGCN 的平均运行时间为 591 秒,而 DiGCN 仅需 30 秒,表明部分模型在效率上具有显著优势。
- 为 SGCN、SNEA、SiGAT、SDGNN、SSSNET 和 MSGNN 提出的损失函数在所有任务中均表现出竞争力,且在标准基准上准确率较高。
- 该库对 DiGCL 的实现,在 Telegram 数据集上的方向预测任务中仅耗时 37 秒,相比原始实现速度更快,同时保持了具有竞争力的准确率。
- 软件的模块化设计和全面测试确保了可靠性与可复现性,具备完整的代码覆盖率和持续集成检查。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。