Skip to main content
QUICK REVIEW

[论文解读] Highly Efficient Knowledge Graph Embedding Learning with Orthogonal Procrustes Analysis

Xutan Peng, Guanyi Chen|arXiv (Cornell University)|Apr 9, 2021
Advanced Graph Neural Networks参考文献 51被引用 17
一句话总结

该论文提出 PROCRUSTES,一种高度高效的知识图谱嵌入框架,通过基于关系矩阵的全批量学习、闭式正交普鲁斯特分析以及非负采样,将训练时间和碳排放分别减少了高达 98.4% 和 99.3%。该方法在单一向量空间中独特地编码了实体和关系信息,生成高度可解释、语义丰富的嵌入,同时保持了具有竞争力的性能。

ABSTRACT

Knowledge Graph Embeddings (KGEs) have been intensively explored in recent years due to their promise for a wide range of applications. However, existing studies focus on improving the final model performance without acknowledging the computational cost of the proposed approaches, in terms of execution time and environmental impact. This paper proposes a simple yet effective KGE framework which can reduce the training time and carbon footprint by orders of magnitudes compared with state-of-the-art approaches, while producing competitive performance. We highlight three technical innovations: full batch learning via relational matrices, closed-form Orthogonal Procrustes Analysis for KGEs, and non-negative-sampling training. In addition, as the first KGE method whose entity embeddings also store full relation information, our trained models encode rich semantics and are highly interpretable. Comprehensive experiments and ablation studies involving 13 strong baselines and two standard datasets verify the effectiveness and efficiency of our algorithm.

研究动机与目标

  • 解决现有知识图谱嵌入(KGE)方法存在的高计算成本与环境影响问题。
  • 开发一种 KGE 框架,显著减少训练时间与二氧化碳排放,同时不牺牲性能。
  • 通过按关系分组 tuple 实现高效并行化的全批量学习。
  • 为 KGE 中的正交普鲁斯特分析引入闭式解法,以加速优化过程。
  • 证明实体嵌入可同时编码实体与关系的丰富语义,从而提升可解释性。

提出的方法

  • 基于关系矩阵的全批量学习:将 tuple 按关系分组,以实现跨批次的高效并行计算。
  • 闭式正交普鲁斯特分析:将普鲁斯特问题的新颖应用引入 KGE,以直接矩阵解替代迭代优化,从而加速训练。
  • 非负采样训练:消除对负采样的需求,降低计算开销与带宽使用。
  • 分段嵌入:将实体表示拆分为独立的子向量(d/ds),以支持并行处理并降低矩阵计算复杂度。
  • 实体与关系语义的联合编码:设计实体嵌入以存储完整的关联关系信息,从而增强可解释性与表达能力。
  • 关系矩阵划分:如图 1 所示,按关系对矩阵进行划分,以支持高效批量处理并减少同步冲突。

实验结果

研究问题

  • RQ1KGE 框架是否能在将训练时间与碳排放减少数个数量级的同时,实现最先进性能?
  • RQ2闭式正交普鲁斯特分析是否可有效应用于 KGE 训练,以替代迭代优化?
  • RQ3非负采样训练是否能在消除昂贵负采样同时保持模型性能?
  • RQ4是否可设计实体嵌入,在单一向量空间中同时编码实体与关系的语义,从而提升可解释性?
  • RQ5所提出的基于关系的矩阵批处理策略相较于标准随机批处理,在速度与可扩展性方面表现如何?

主要发现

  • PROCRUSTES 在标准基准测试上相比最先进 KGE 方法,将训练时间最多减少了 98.4%。
  • 该方法将碳排放最多减少了 99.3%,相当于每次训练运行的碳排放量不足两杯咖啡的水平。
  • PROCRUSTES 生成的实体嵌入具有高度可解释性,3D PCA 可视化显示了与地点、生化术语和职业等类别相对应的清晰语义聚类。
  • 该模型在 WN18RR 和 FB15k-237 上表现具有竞争力,链接预测任务中的性能达到或超过最先进水平。
  • 该框架成功在单一向量空间中编码了实体与关系的语义,生成的表示比以往方法更具丰富性与可解释性。
  • 消融实验表明,每个组件——关系批处理、闭式普鲁斯特分析与非负采样——均对效率与性能有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。