Skip to main content
QUICK REVIEW

[论文解读] KI-BERT: Infusing Knowledge Context for Better Language and Domain Understanding

Keyur Faldu, Amit Sheth|arXiv (Cornell University)|Apr 9, 2021
Topic Modeling被引用 9
一句话总结

KI-BERT 提出了一种新颖的方法,在微调过程中通过使用实体标记类型、向量空间投影、位置对齐和选择性注意力,将 ConceptNet 和 WordNet 中的知识上下文注入 BERT。该方法在 SciTail 和 QQP、MNLI、QNLI 的学术子集等特定领域任务中显著优于 BERT-base,甚至超越了 BERT-large。

ABSTRACT

Contextualized entity representations learned by state-of-the-art transformer-based language models (TLMs) like BERT, GPT, T5, etc., leverage the attention mechanism to learn the data context from training data corpus. However, these models do not use the knowledge context. Knowledge context can be understood as semantics about entities and their relationship with neighboring entities in knowledge graphs. We propose a novel and effective technique to infuse knowledge context from multiple knowledge graphs for conceptual and ambiguous entities into TLMs during fine-tuning. It projects knowledge graph embeddings in the homogeneous vector-space, introduces new token-types for entities, aligns entity position ids, and a selective attention mechanism. We take BERT as a baseline model and implement the "Knowledge-Infused BERT" by infusing knowledge context from ConceptNet and WordNet, which significantly outperforms BERT and other recent knowledge-aware BERT variants like ERNIE, SenseBERT, and BERT_CS over eight different subtasks of GLUE benchmark. The KI-BERT-base model even significantly outperforms BERT-large for domain-specific tasks like SciTail and academic subsets of QQP, QNLI, and MNLI.

研究动机与目标

  • 解决当前基于 Transformer 的语言模型(如 BERT)在未显式利用知识图谱中的知识上下文方面的局限性。
  • 通过在微调过程中注入来自外部知识图谱的实体及其关系的语义知识,提升语言理解与领域理解能力。
  • 开发一种有效处理概念性实体(例如‘第一次世界大战’)和歧义性实体(例如具有多重含义的‘drain’)的技术。
  • 证明在微调阶段注入知识可带来更优性能,尤其在低资源或特定领域数据集上表现更佳。
  • 发布一个领域自适应、知识增强的 BERT 变体(KI-BERT),其在基准任务上的表现优于 BERT 及其他知识增强模型。

提出的方法

  • 使用线性变换将知识图谱嵌入(来自 ConceptNet 和 WordNet)投影到与 BERT 隐状态相同的向量空间中。
  • 引入新的实体标记类型以区分实体标记与普通标记,从而支持专用注意力机制。
  • 将输入序列中的实体位置与知识图谱中的对应位置对齐,以保留结构上下文。
  • 应用选择性注意力机制,根据上下文动态关注相关知识图谱邻居,提升对相关事实的关注度。
  • 端到端微调增强后的 BERT 模型,使知识注入在上下文中得以学习。
  • 在注入与词义相关的知识前,使用消歧模型识别多义词(如‘mass’、‘drain’)的正确词义,从而从 WordNet 注入特定词义的知识。

实验结果

研究问题

  • RQ1来自外部知识图谱的知识上下文能否提升 BERT 在下游自然语言处理任务中的性能,尤其是在低资源或特定领域设置下?
  • RQ2在微调过程中同时注入概念性实体(如历史事件)和歧义性实体(如多义词)的知识,对模型泛化能力和推理能力有何影响?
  • RQ3在微调阶段注入知识是否优于在预训练阶段集成知识,或完全不注入知识?
  • RQ4KI-BERT 的性能提升在训练数据量减少时是否仍能有效扩展,特别是在特定领域自然语言处理任务中?
  • RQ5选择性注意力和实体特定的标记类型是否能有效引导模型利用相关知识,而不破坏已学习的表示?

主要发现

  • KI-BERT-base 在 GLUE 上取得 80.47 的平均分,显著优于 BERT-base(78.9),并在特定领域基准上超越了 BERT-large。
  • KI-BERT-base 在 SciTail(科学领域任务)以及 QQP、QNLI 和 MNLI 的学术子集上优于 BERT-large,尽管其参数量仅为 BERT-large 的约三分之一。
  • 知识注入带来的性能增益在较小数据集上最为显著,表明其在低资源领域适应方面具有很强适用性。
  • 消融实验证明,若移除任一组件(选择性注意力、实体标记类型、位置对齐或向量空间投影),性能均会出现可测量的下降。
  • 注入知识上下文使正确答案的预测置信度平均提升 3.3%,当注入更多实体时,置信度额外提升 1.5%。
  • KI-BERT 在正确预测上保持高置信度(例如 BERT 为 99.99%,KI-BERT 提升至约 97%),同时降低对错误预测的过度自信,表明其推理鲁棒性得到改善。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。