[论文解读] CoLAKE: Contextualized Language and Knowledge Embedding
CoLAKE 提出了一种统一框架,通过将语言与知识整合到一个词-知识图(WK 图)中,联合学习上下文相关的语言与知识表征,将掩码语言建模目标扩展为同时预测被掩码的词、实体和关系。该方法在知识密集型自然语言处理任务及一项新颖的词-知识图补全任务上均取得了最先进性能,相较于先前模型展现出更优的归纳偏置与结构感知能力。
With the emerging branch of incorporating factual knowledge into pre-trained language models such as BERT, most existing models consider shallow, static, and separately pre-trained entity embeddings, which limits the performance gains of these models. Few works explore the potential of deep contextualized knowledge representation when injecting knowledge. In this paper, we propose the Contextualized Language and Knowledge Embedding (CoLAKE), which jointly learns contextualized representation for both language and knowledge with the extended MLM objective. Instead of injecting only entity embeddings, CoLAKE extracts the knowledge context of an entity from large-scale knowledge bases. To handle the heterogeneity of knowledge context and language context, we integrate them in a unified data structure, word-knowledge graph (WK graph). CoLAKE is pre-trained on large-scale WK graphs with the modified Transformer encoder. We conduct experiments on knowledge-driven tasks, knowledge probing tasks, and language understanding tasks. Experimental results show that CoLAKE outperforms previous counterparts on most of the tasks. Besides, CoLAKE achieves surprisingly high performance on our synthetic task called word-knowledge graph completion, which shows the superiority of simultaneously contextualizing language and knowledge representation.
研究动机与目标
- 解决现有知识增强型语言模型中静态、独立预训练实体嵌入的局限性。
- 通过整合实体周围的子图形式的事实知识,实现动态、上下文感知的知识表征。
- 将异构的语言与知识结构统一为单一、连贯的输入格式,以支持联合表征学习。
- 评估模型在未见实体上的泛化能力,以及对知识结构与语义特征的捕捉能力。
- 探索所提出的词-知识图作为下游知识密集型自然语言处理应用基础的潜力。
提出的方法
- 构建一个词-知识图(WK 图),将全连接的词图与从大规模知识库中提取的知识子图进行整合。
- 利用文本中的实体提及,检索并拼接以这些实体为中心的知识子图,嵌入 WK 图中。
- 修改 Transformer 编码器以处理异构的 WK 图输入,其注意力机制经调整以处理不同类型的节点(词、实体、关系)。
- 将掩码语言建模(MLM)目标扩展为在 WK 图中同时掩码并预测词、实体与关系。
- 使用扩展的 MLM 目标在大规模 WK 图上预训练 CoLAKE,实现语言与知识表征的联合优化。
- 采用邻接矩阵编码图结构,并在编码器的消息传递过程中引导信息流动。
实验结果
研究问题
- RQ1与采用静态实体嵌入的模型相比,联合学习上下文相关的语言与知识表征是否能提升知识密集型自然语言处理任务的性能?
- RQ2模型在多大程度上能有效利用动态知识上下文(即实体周围的子图)而非单一实体嵌入,以改善上下文理解?
- RQ3所提出的词-知识图(WK 图)结构在多大程度上支持对未见实体的归纳泛化?
- RQ4与传统知识嵌入模型相比,CoLAKE 在一项新颖的合成任务——词-知识图补全上的表现如何?
- RQ5语言与知识表征的联合建模是否能更好地保留学习到的嵌入中的结构与语义特征?
主要发现
- CoLAKE 在 GLUE 基准的大多数知识驱动任务与语言理解任务中,优于先前的半上下文化联合模型。
- 在归纳设定下的词-知识图补全任务中,CoLAKE 在 transductive 设置下达到 82.48 的平均倒数排名(MRR),显著优于 TransE(67.30)、DistMult(60.56)、ComplEx(61.09)与 RotatE(70.90)。
- 在归纳设定下,CoLAKE 的 MRR 达到 28.10,远超 DKRL 的 8.18,展现出对未见实体的强大泛化能力。
- 模型在合成词-知识图补全任务上的表现,证实其能有效利用图结构信息与语义文本上下文。
- CoLAKE 展现出强大的归纳偏置,其通过邻域信息生成实体表征,而非依赖固定或基于描述的嵌入。
- 结果表明,WK 图是一种强大且具备结构感知能力的表征,可有效支持知识密集型自然语言处理应用中的迁移学习与泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。