Skip to main content
QUICK REVIEW

[论文解读] Knowledge Enhanced Contextual Word Representations

Matthew E. Peters, Mark E Neumann|arXiv (Cornell University)|Sep 9, 2019
Topic Modeling参考文献 66被引用 12
一句话总结

本文提出 KnowBert,一种通过使用知识注意力与再上下文化(KAR)机制,将来自多个知识库(KBs)如 WordNet 和 Wikipedia 的结构化知识整合到 BERT 的上下文词表示中的方法。通过在无标签文本上联合训练实体链接器与语言模型,KnowBert 提升了事实召回率,降低了困惑度,并在关系抽取、实体类型识别和词义消歧等下游任务中达到最先进性能,优于 BERT$_{\text{LARGE}}$ 在多个基准测试中的表现。

ABSTRACT

Contextual word representations, typically trained on unstructured, unlabeled text, do not contain any explicit grounding to real world entities and are often unable to remember facts about those entities. We propose a general method to embed multiple knowledge bases (KBs) into large scale models, and thereby enhance their representations with structured, human-curated knowledge. For each KB, we first use an integrated entity linker to retrieve relevant entity embeddings, then update contextual word representations via a form of word-to-entity attention. In contrast to previous approaches, the entity linkers and self-supervised language modeling objective are jointly trained end-to-end in a multitask setting that combines a small amount of entity linking supervision with a large amount of raw text. After integrating WordNet and a subset of Wikipedia into BERT, the knowledge enhanced BERT (KnowBert) demonstrates improved perplexity, ability to recall facts as measured in a probing task and downstream performance on relationship extraction, entity typing, and word sense disambiguation. KnowBert's runtime is comparable to BERT's and it scales to large KBs.

研究动机与目标

  • 解决上下文词表示在保留现实世界实体事实知识方面的局限性。
  • 开发一种通用且可扩展的方法,将多个知识库整合到大规模预训练语言模型中,而无需针对特定任务进行微调。
  • 通过将上下文表示基于结构化知识进行定位,提升掩码语言建模的困惑度与事实召回率。
  • 在需要事实推理的下游 NLP 任务(如关系抽取和词义消歧)中实现最先进性能。
  • 通过将知识注入作为轻量级模块插入,保持计算效率并兼容现有 BERT 基础系统。

提出的方法

  • 引入一个知识注意力与再上下文化(KAR)模块,插入 BERT 的两层之间,以注入来自外部 KB 的知识。
  • 使用集成的实体链接器从 KB(如 WordNet、Wikipedia)检索输入文本中词段的实体嵌入。
  • 应用词到实体的注意力机制,利用检索到的实体嵌入对上下文词表示进行再上下文化,实现长距离交互。
  • 通过结合自监督语言建模与少量无标签文本上的实体链接监督信号,联合预训练实体链接器与语言模型。
  • 插入特殊标记 [E1]、[/E1]、[E2]、[/E2] 以标记关系抽取中的主语与宾语词段,以及 [E]、[/E] 用于实体类型识别。
  • 使用 TuckER 进行实体嵌入,并通过最少的结构要求确保与多种 KB 格式兼容。

实验结果

研究问题

  • RQ1将来自多个 KB 的结构化知识整合是否能提升预训练模型中上下文词表示的事实召回率与质量?
  • RQ2在无标签文本上对实体链接与语言建模进行端到端联合训练,是否能带来更好的泛化能力与事实知识整合效果?
  • RQ3在 BERT 中轻量化、模块化地插入知识,是否能在不牺牲推理速度的前提下提升下游 NLP 任务的性能?
  • RQ4在内在与外在评估中,增强模型的性能与 BERT$_{\text{LARGE}}$ 及其他知识增强模型相比如何?
  • RQ5该方法在大规模 KB 上的可扩展性如何?是否能支持 ConceptNet 或领域特定 KB 等多样化知识源?

主要发现

  • KnowBert-W+W 在 WiC 数据集上取得 76.1 的测试 F1 分数,优于 BERT$_{\text{LARGE}}$ 1.4%,并将与人类表现的差距缩小了 13.3%。
  • 在 TACRED 关系抽取任务中,KnowBert-W+W 达到 70.9% 的 F1 分数,优于 BERT$_{\text{LARGE}}$ 1.4% 与 ERNIE 3.5%。
  • 在实体类型识别任务中,KnowBert-W+W 取得 76.1 的 F1 分数,较 ERNIE 提升 0.6%,较 BERT$_{\text{BASE}}$ 提升 2.5%。
  • 与 BERT$_{\text{BASE}}$ 相比,该模型在掩码语言建模中的困惑度更低,表明知识注入后语言建模质量得到提升。
  • 尽管使用了更小的 BERT$_{\text{BASE}}$ 架构,KnowBert-W+W 在事实召回率与内在探测任务中仍优于 BERT$_{\text{LARGE}}$。
  • KAR 模块引入的计算开销极小,运行时间与 BERT 相当,且可在下游应用中无缝替换 BERT 为 KnowBert。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。