[论文解读] Dipping PLMs Sauce: Bridging Structure and Text for Effective Knowledge Graph Completion via Conditional Soft Prompting
该论文提出CSProm-KG,一种新颖的框架,通过条件软提示将知识图谱(KG)的结构信息与预训练语言模型(PLM)的文本知识相融合。通过基于实体和关系嵌入生成提示,CSProm-KG在不微调PLM的情况下有效融合了两种模态,实现了在多个静态和时序KGC基准上的最先进性能,包括在WN18RR、FB15K-237、Wikidata5M、ICEWS14和ICEWS05-15上的新SOTA结果。
Knowledge Graph Completion (KGC) often requires both KG structural and textual information to be effective. Pre-trained Language Models (PLMs) have been used to learn the textual information, usually under the fine-tune paradigm for the KGC task. However, the fine-tuned PLMs often overwhelmingly focus on the textual information and overlook structural knowledge. To tackle this issue, this paper proposes CSProm-KG (Conditional Soft Prompts for KGC) which maintains a balance between structural information and textual knowledge. CSProm-KG only tunes the parameters of Conditional Soft Prompts that are generated by the entities and relations representations. We verify the effectiveness of CSProm-KG on three popular static KGC benchmarks WN18RR, FB15K-237 and Wikidata5M, and two temporal KGC benchmarks ICEWS14 and ICEWS05-15. CSProm-KG outperforms competitive baseline models and sets new state-of-the-art on these benchmarks. We conduct further analysis to show (i) the effectiveness of our proposed components, (ii) the efficiency of CSProm-KG, and (iii) the flexibility of CSProm-KG.
研究动机与目标
- 解决基于PLM的KGC模型中过度依赖文本信息而忽视知识图谱结构知识的不平衡问题。
- 开发一种方法,无需对PLM进行完整微调,即可有效将KG中的结构信息整合到冻结的PLM中。
- 在防止对实体预测中表面文本相似性的过度依赖的同时,保持高性能与高效率。
- 通过模块化的提示机制,实现与多种基于图的KGC模型的灵活集成。
- 在包括静态(WN18RR、FB15K-237、Wikidata5M)和时序(ICEWS14、ICEWS05-15)KGC任务在内的多样化基准上展示有效性。
提出的方法
- 引入条件软提示(CSProm),其动态生成自实体和关系嵌入,从而在PLM输入中实现对结构信息的感知性条件控制。
- 使用冻结的PLM编码实体和关系的文本描述,同时仅微调软提示参数,以避免对文本信息的过拟合。
- 将生成的条件软提示输入到冻结的PLM中,生成融合了文本与结构知识的上下文表示。
- 将融合后的表示与基于图的KGC模型(如TransE、DistMult、ConvE)结合,用于最终的实体打分与排序。
- 应用局部对抗正则化,通过增强对对抗扰动的鲁棒性,提升对文本相似实体的判别能力。
- 仅更新软提示参数,端到端训练模型,从而在保留PLM预训练知识的同时,适应KGC任务。
实验结果
研究问题
- RQ1我们能否在不微调PLM的情况下,有效平衡基于PLM的KGC模型中的文本与结构知识?
- RQ2与无条件软提示相比,基于实体和关系嵌入对软提示进行条件化是否能提升性能与鲁棒性?
- RQ3所提出的方法是否能跨多种基于图的KGC模型泛化且保持高效?
- RQ4CSProm-KG在静态与时序KGC基准上的表现相较于强基线如何?
- RQ5该模型在模糊情况下对文本相似性的过拟合程度在多大程度上得以避免?
主要发现
- CSProm-KG在全部五个基准上均取得新的SOTA性能:WN18RR、FB15K-237、Wikidata5M、ICEWS14和ICEWS05-15。
- 在WN18RR上,当与TransE结合时,CSProm-KG将MRR从0.243提升至0.499,H@1从0.043提升至0.462。
- 在DistMult上,CSProm-KG将MRR从0.444提升至0.543,H@1从0.412提升至0.494,表明在各类模型上均保持一致的性能增益。
- 在ConvE上,CSProm-KG实现了MRR 0.575和H@1 0.522,相较于基线模型分别提升了0.119和0.103,表现显著。
- 案例研究证实,CSProm-KG能正确识别结构相关的实体(如Grammy Award),同时避免选择文本上相似的干扰项(如Razzie Award),而无条件提示模型则无法做到这一点。
- 消融研究显示,条件软提示在平衡文本与结构知识方面显著优于标准软提示和微调基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。