Skip to main content
QUICK REVIEW

[论文解读] ParaGraphE: A Library for Parallel Knowledge Graph Embedding

Xiao-Fan Niu, Wu-Jun Li|arXiv (Cornell University)|Mar 16, 2017
Advanced Graph Neural Networks参考文献 6被引用 6
一句话总结

ParaGraphE 是一个并行库,通过使用统一的无锁框架在多个线程之间分配训练任务,加速知识图谱嵌入,可在 FB15k 和 WN18 等大规模数据集上实现高达 8 倍的加速,且不损失准确性,同时支持多种嵌入方法,包括 TransE、TransH、TransR、TransD 和 SphereE。

ABSTRACT

Knowledge graph embedding aims at translating the knowledge graph into numerical representations by transforming the entities and relations into continuous low-dimensional vectors. Recently, many methods [1, 5, 3, 2, 6] have been proposed to deal with this problem, but existing single-thread implementations of them are time-consuming for large-scale knowledge graphs. Here, we design a unified parallel framework to parallelize these methods, which achieves a significant time reduction without influencing the accuracy. We name our framework as ParaGraphE, which provides a library for parallel knowledge graph embedding. The source code can be downloaded from https://github.com/LIBBLE/LIBBLE-MultiThread/tree/master/ParaGraphE .

研究动机与目标

  • 解决在大规模知识图谱上训练单线程知识图谱嵌入方法时计算成本过高的问题。
  • 设计一个统一且可扩展的框架,以并行化现有的基于边缘的知識圖譜嵌入方法,而不改变其核心学习目标。
  • 在保持最先进模型精度的同时,显著缩短训练时间。
  • 通过无锁多线程实现,实现高效可扩展的知识图谱嵌入训练。
  • 提供一个通用库,支持多种嵌入模型,并可扩展至其他基于图的学习任务。

提出的方法

  • 基于无锁线程调度实现统一的并行训练框架,以避免在嵌入更新过程中出现同步瓶颈。
  • 使用基于边缘的合页损失函数,公式为 $\mathcal{L} = \sum_{(h,r,t)\in S} \sum_{(h',r,t')\in S'} [s(h,r,t) + \gamma - s(h',r,t')]_+$,其中 $S$ 是正样本三元组集合,$S'$ 是被破坏的负样本集合。
  • 将训练样本分配给 $p$ 个线程,每个线程独立采样正样本和负样本三元组,计算梯度,并并行更新嵌入。
  • 在每次更新后强制执行归一化约束(例如,$\|\mathbf{h}\|_2 = 1$),以保持模型在不同方法下的稳定性和一致性。
  • 为每种方法支持多种得分函数和约束(例如,TransE 使用 $s(h,r,t) = \|\mathbf{h} + \mathbf{r} - \mathbf{t}\|$;TransH 使用基于关系特定法向量的投影)。
  • 通过将差异抽象为得分函数和约束,与现有嵌入模型集成,实现对 TransE、TransH、TransR、TransD 和 SphereE 的即插即用支持。

实验结果

研究问题

  • RQ1统一的并行框架是否能在不降低性能的情况下显著减少知识图谱嵌入模型的训练时间?
  • RQ2与单线程基线相比,多线程训练如何影响收敛性和模型精度?
  • RQ3ParaGraphE 在不同规模和复杂度的知识图谱(如 WN18 和 FB15k)上可扩展到何种程度?
  • RQ4同一框架能否高效支持具有不同得分函数和约束的多样化知识图谱嵌入方法?
  • RQ5在标准基准数据集上,ParaGraphE 从 1 个线程扩展到 10 个线程时,可实现多大的加速比?

主要发现

  • 在使用 10 个线程时,ParaGraphE 在 WN18 和 FB15k 上均实现了高达 8 倍的加速,且收敛过程稳定,表现为损失曲线平稳。
  • 训练时间大幅缩短:在 FB15k 上,TransR 的训练时间缩短至 165.0 秒,远短于原始实现中的时间。
  • 模型精度保持高度竞争力——在 WN18 和 FB15k 上的结果与原始论文报告的非常接近,SphereE 在 FB15k 上的 MRR(过滤)为 0.464,hits@10 为 0.699。
  • 该框架在所有支持的模型(TransE、TransH、TransR、TransD 和 SphereE)上均保持一致的性能,精度下降可忽略不计。
  • 不同线程数(1 至 10)下的损失曲线显示收敛稳定,表明并行化未损害优化过程。
  • 由于采用无锁设计,该库实现了高效的可扩展训练,同步开销极小,可在多核系统上实现高吞吐量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。