[论文解读] A Survey of Knowledge Enhanced Pre-trained Language Models
本综述为知识增强型预训练语言模型(KE-PLMs)提供了全面的分类体系,涵盖自然语言理解(NLU)与自然语言生成(NLG)任务。按知识类型将方法分类为语言学知识、文本知识、知识图谱知识和规则知识(用于NLU),以及基于检索或基于知识图谱的方法(用于NLG)。本文识别了关键挑战,并提出了未来研究方向,包括可解释性、持续学习、效率优化和输出多样性。
Pre-trained Language Models (PLMs) which are trained on large text corpus via self-supervised learning method, have yielded promising performance on various tasks in Natural Language Processing (NLP). However, though PLMs with huge parameters can effectively possess rich knowledge learned from massive training text and benefit downstream tasks at the fine-tuning stage, they still have some limitations such as poor reasoning ability due to the lack of external knowledge. Research has been dedicated to incorporating knowledge into PLMs to tackle these issues. In this paper, we present a comprehensive review of Knowledge Enhanced Pre-trained Language Models (KE-PLMs) to provide a clear insight into this thriving field. We introduce appropriate taxonomies respectively for Natural Language Understanding (NLU) and Natural Language Generation (NLG) to highlight these two main tasks of NLP. For NLU, we divide the types of knowledge into four categories: linguistic knowledge, text knowledge, knowledge graph (KG), and rule knowledge. The KE-PLMs for NLG are categorized into KG-based and retrieval-based methods. Finally, we point out some promising future directions of KE-PLMs.
研究动机与目标
- 为自然语言理解(NLU)与自然语言生成(NLG)任务中知识增强型预训练语言模型(KE-PLMs)提供系统性综述,以满足两类任务的特定需求。
- 为NLU中的KE-PLMs建立专用分类体系(基于知识类型:语言学、文本、知识图谱、规则),为NLG中的KE-PLMs建立分类体系(基于知识来源:基于检索、基于知识图谱)。
- 识别并分析KE-PLMs中的关键挑战,包括可解释性、灾难性遗忘、计算效率和生成多样性。
- 提出未来研究方向,以推动KE-PLMs的发展,如持续知识集成与高效知识融合。
提出的方法
- 提出双分类框架:NLU基于知识类型(语言学、文本、知识图谱、规则),NLG基于知识来源(基于检索、基于知识图谱)。
- 回顾各类别中的代表性模型,如ERNIE-VIL(用于跨模态知识注入)和GRF(用于知识图谱的多跳推理)。
- 引入持续知识学习方法,包括ELLE(模型扩展)和K-adapter(基于适配器的知识存储),以缓解灾难性遗忘。
- 提出知识注入效率优化策略,如基于ZeRO的参数分区,以降低内存开销。
- 探索提升多样性的技术,如MoKGE,其利用专家混合与多样化常识推理,生成多个合理输出。
- 通过显式推理路径分析可解释性,如GRF所示,以提升模型透明度与逻辑一致性。
实验结果
研究问题
- RQ1如何系统性地对知识进行分类并将其整合到预训练语言模型中,以支持NLU与NLG任务?
- RQ2传统PLMs在推理与常识生成方面存在哪些关键局限?KE-PLMs如何解决这些问题?
- RQ3KE-PLMs如何在随时间动态引入新知识的同时,避免遗忘已有知识?
- RQ4有哪些策略可提升大规模PLMs中知识注入的计算效率?
- RQ5如何增强KE-PLMs以生成多样化、上下文相关且逻辑一致的输出?
主要发现
- KE-PLMs显著提升了NLU任务中的事实准确性——例如,在掩码语言建模中能正确预测‘天安门’而非‘the’,通过引入外部知识。
- 在NLG中,知识增强型模型生成的句子更自然且合乎逻辑,如‘男人正在水槽里用肥皂洗手’,而未增强模型可能生成语法正确但不合逻辑的输出。
- 如GRF等模型通过生成显式推理路径,实现更高的可解释性,增强了预测的透明度与逻辑一致性。
- 持续学习方法如ELLE与K-adapter通过扩展模型容量或使用适配器模块逐步存储知识,有效缓解了灾难性遗忘。
- 效率优化框架如ZeRO通过在设备间分区模型参数、梯度与优化器状态,显著降低了内存开销。
- 多样性增强方法如MoKGE通过利用常识知识图谱中的异构路径,生成多个合理输出,提升了生成任务中的输出多样性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。