Skip to main content
QUICK REVIEW

[论文解读] Does Knowledge Help General NLU? An Empirical Study

Ruochen Xu, Yuwei Fang|arXiv (Cornell University)|Sep 1, 2021
Topic Modeling参考文献 35被引用 7
一句话总结

本文通过实证研究检验了外部知识是否能提升通用自然语言理解(NLU)任务的性能。研究在4个预训练模型和10个NLU任务上,采用非侵入式方法评估了基于文本描述和嵌入的外部知识整合方式,发现知识可使平均F1得分提升0.46分,并通过保留输入信息和过滤与任务无关的特征,增强模型的泛化能力。

ABSTRACT

It is often observed in knowledge-centric tasks (e.g., common sense question and answering, relation classification) that the integration of external knowledge such as entity representation into language models can help provide useful information to boost the performance. However, it is still unclear whether this benefit can extend to general natural language understanding (NLU) tasks. In this work, we empirically investigated the contribution of external knowledge by measuring the end-to-end performance of language models with various knowledge integration methods. We find that the introduction of knowledge can significantly improve the results on certain tasks while having no adverse effects on other tasks. We then employ mutual information to reflect the difference brought by knowledge and a neural interpretation model to reveal how a language model utilizes external knowledge. Our study provides valuable insights and guidance for practitioners to equip NLP models with knowledge.

研究动机与目标

  • 确定外部知识是否能在知识中心应用之外的通用NLU任务中提升性能。
  • 识别在多样化NLU任务中带来最大收益的知识来源和整合方法。
  • 评估不同知识整合技术与预训练语言模型在提升NLU性能方面的有效性。
  • 利用可解释性工具和互信息分析,探究知识如何影响模型决策过程,而不仅限于端到端准确率。
  • 为实践者提供切实可行的建议,以有效为NLP模型配备外部知识,用于通用NLU任务。

提出的方法

  • 采用两种非侵入式知识整合方法:知识作为文本(KT),将实体描述注入输入标记;知识作为嵌入(KE),将实体嵌入添加到上下文表示中。
  • 将两种方法应用于四个预训练语言模型:RoBERTa-base、BERT-base、ELECTRA-base 和 DistilBERT。
  • 使用互信息(MI)估计量化知识对输入(x)和输出(y)信息保留的影响,其中MI通过重构误差和交叉熵损失进行近似。
  • 采用DiffMask(一种神经可解释性模型)可视化每一层中模型认为重要的输入标记,从而分析知识整合导致的决策过程变化。
  • 在10项通用NLU任务上开展广泛实验,包括情感分类、自然语言蕴含、句子相似度、词性标注和命名实体识别。
  • 在每个Transformer层l处估计互信息差异ΔI(c^(l);x)和ΔI(c^(l);y),以评估知识如何改变信息流与抽象过程。

实验结果

研究问题

  • RQ1外部知识是否总体上提升了通用NLU任务的性能?
  • RQ2哪些知识来源和哪些NLU任务从知识整合中获益最多?
  • RQ3在相同实验设置下,哪种知识整合方法最有效?
  • RQ4哪些大规模预训练语言模型从外部知识中受益最多?
  • RQ5我们能否在端到端性能之外检测到知识的影响?如果可以,模型如何利用它?

主要发现

  • 在所有10个NLU任务和4个模型上,知识整合使平均F1得分提升0.46分,特定任务如CoLA和RTE的提升尤为显著。
  • KT-Attn方法实现了最高的互信息增益,相比原始RoBERTa-base基线,能保留更多输入信息并剔除更多与任务无关的特征。
  • 知识整合导致无关信息逐渐减少,同时输出相关特征的保留程度提高,这一过程从第6层开始,并持续向深层发展。
  • 尽管知识仅应用于特定标记(如动词、名词、形容词),但其影响扩展至所有标记的注意力机制,从而在CoLA等任务上提升了泛化能力。
  • DiffMask分析表明,KT-Attn能正确识别出对预测无影响的词语(如否定词“not”或复杂短语“Sue to stay”)为不重要,表明其推理能力得到改善。
  • 知识整合后,平均有更多Transformer层将特定词性标签(如PRON、ADP、NUM)识别为重要,表明其对模型行为产生了更广泛的影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。