Skip to main content
QUICK REVIEW

[论文解读] Knowledge Base Completion: Baseline strikes back (Again)

Prachi Jain, Sushant Rathi|arXiv (Cornell University)|May 2, 2020
Advanced Graph Neural Networks参考文献 18被引用 6
一句话总结

本文展示了通过使用全面负采样训练ComplEx模型(称为Complex-V2)可在多个KBC基准上实现最先进或接近最先进性能,优于许多近期提出的模型。通过利用1-N评分和高效的向量化评估,Complex-V2在不改变模型架构的前提下实现了更高的准确率,挑战了对复杂新模型设计的必要性,并重新定义了未来KBC研究的基线。

ABSTRACT

Knowledge Base Completion (KBC) has been a very active area lately. Several recent KBCpapers propose architectural changes, new training methods, or even new formulations. KBC systems are usually evaluated on standard benchmark datasets: FB15k, FB15k-237, WN18, WN18RR, and Yago3-10. Most existing methods train with a small number of negative samples for each positive instance in these datasets to save computational costs. This paper discusses how recent developments allow us to use all available negative samples for training. We show that Complex, when trained using all available negative samples, gives near state-of-the-art performance on all the datasets. We call this approach COMPLEX-V2. We also highlight how various multiplicative KBC methods, recently proposed in the literature, benefit from this train-ing regime and become indistinguishable in terms of performance on most datasets. Our work calls for a reassessment of their individual value, in light of these findings.

研究动机与目标

  • 探究在改进的训练方案下,较老且广泛使用的KBC模型是否能实现最先进性能。
  • 评估大规模负采样对模型性能的影响,尤其是在资源受限环境下的表现。
  • 通过表明性能提升可能源于训练方法而非架构创新,挑战近期KBC模型架构的公认价值。
  • 确立Complex-V2作为未来KBC研究中强大且可复现的基线。

提出的方法

  • 作者在训练过程中将所有实体作为负样本,重新训练ComplEx模型,该训练方案被称为Complex-V2。
  • 他们采用1-N评分——对给定的主语-关系对评估所有可能的对象实体——以实现对比损失的高效向量化计算。
  • 对于RotatE等模型,由于1-N评分内存开销较大,他们通过在多个小批量上累积梯度来模拟使用所有负样本的训练。
  • 他们在多个数据集(FB15k、WN18、YAGO3-10、FB15k-237、WN18RR)上比较性能,以平均倒数排名(MRR)为主要指标。
  • 他们分析了负样本数量对性能的影响,发现MRR在每正样本约2,000个负样本时趋于稳定。
  • 他们在相同的大型负样本训练方案下重新训练其他模型(如RotatE、SimplE),分别命名为RotatE-V2和SimplE-V2。

实验结果

研究问题

  • RQ1当使用全面负采样进行训练时,像ComplEx这样简单且成熟的模型是否能实现最先进性能?
  • RQ2当新旧模型均在相同的大型负样本训练方案下训练时,近期KBC模型与旧模型之间的性能差距是否会缩小?
  • RQ3与改进的训练实践相比,近期KBC模型中的架构创新在多大程度上促成了性能提升?
  • RQ4梯度累积是否能使像RotatE这样难以扩展1-N评分的模型实现大规模负采样?
  • RQ5Complex-V2是否是未来KBC模型评估中可行且更优的基线?

主要发现

  • Complex-V2(即使用所有实体作为负样本训练的ComplEx模型)在所有评估数据集(包括FB15k、WN18、YAGO3-10、FB15k-237和WN18RR)上均实现了最先进或接近最先进性能。
  • 在FB15k上,随着负样本数量增加,Complex-V2的MRR显著提升,且在每正样本约2,000个负样本时趋于稳定。
  • 通过梯度累积以所有实体作为负样本训练的RotatE-V2,在FB15k、FB15k-237和YAGO3-10上相比标准训练(使用256个负样本)的MRR最高提升达3个百分点。
  • 将TransE和RotatE中的L1范数改为L2范数,分别导致MRR下降7.8和6.5个百分点,表明对这些模型而言,使用L2范数的向量化对比损失不可行。
  • Complex-V2与近期SOTA模型之间的性能差距极小甚至不存在,表明架构新颖性可能并非性能提升的主要驱动力。
  • 研究结论认为,Complex-V2应成为KBC的新基线,因为任何新模型必须超越它才能证明其实际价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。