[论文解读] Can Generative Pre-trained Language Models Serve as Knowledge Bases for Closed-book QA?
本文研究了像 BART 这类生成式预训练语言模型是否可以通过构建基于 SQuAD 的可追溯知识源新基准,作为闭卷问答的内部知识库。尽管在受控环境下具备较强的事实记忆能力,BART 在闭卷 QA 任务中仍因知识保留和检索能力差而表现不佳,但将预训练与微调解耦以及通过提示工程促进知识召回的方法显示出改善性能的潜力。
Recent work has investigated the interesting question using pre-trained language models (PLMs) as knowledge bases for answering open questions. However, existing work is limited in using small benchmarks with high test-train overlaps. We construct a new dataset of closed-book QA using SQuAD, and investigate the performance of BART. Experiments show that it is challenging for BART to remember training facts in high precision, and also challenging to answer closed-book questions even if relevant knowledge is retained. Some promising directions are found, including decoupling the knowledge memorizing process and the QA finetune process, forcing the model to recall relevant knowledge when question answering.
研究动机与目标
- 评估生成式预训练语言模型(如 BART)是否能在无需外部检索的情况下,作为闭卷问答的内部知识库使用。
- 通过使用 SQuAD 构建新基准并引入可追溯的维基百科段落,解决先前研究依赖小规模基准且测试集与训练集重叠度高的局限性。
- 分离并分析闭卷问答中的两个核心挑战:(1) 准确记忆事实性知识,(2) 检索并利用这些知识回答问题。
- 研究 QA 微调是否会对语言模型预训练中记忆的事实性知识造成负面影响,以及是否存在其他训练策略可提升性能。
提出的方法
- 使用 SQuAD 构建新的闭卷问答基准,每个问题均配对其来源维基百科段落,以支持可追溯的知识评估。
- 在相关段落上对 BART 进行语言模型微调(LM-finetuning),以增强事实性知识的记忆能力。
- 通过“复述”任务评估知识保留情况——测量模型从段落中重建事实片段的能力,考察不同数量训练段落下的表现。
- 在 LM-fine-tuned BART 模型上进行 QA 微调,以评估下游闭卷 QA 性能,即使训练和测试问题基于相同知识来源。
- 探索数据增强技术,如在推理阶段将相关段落注入测试输出,以改善知识检索。
- 提出并评估一种解耦训练策略,将语言模型微调与 QA 微调过程分离,以在任务特定微调中保留事实性知识。
实验结果
研究问题
- RQ1当在多样化段落集合上进行语言建模目标微调时,生成式预训练语言模型(如 BART)能否有效记忆事实性知识?
- RQ2尽管 BART 在事实知识保留方面表现良好,其在闭卷 QA 上的性能是否仍会下降,表明知识检索或利用存在失败?
- RQ3QA 微调在多大程度上干扰了语言模型微调期间记忆的事实性知识?
- RQ4简单的数据增强技术(如在测试输入中注入相关段落)是否能通过辅助知识检索来提升闭卷 QA 性能?
- RQ5将语言模型微调与 QA 微调过程解耦,是否能更好地保留事实性知识并提升 QA 准确率?
主要发现
- 尽管在其他测试-训练重叠度高的数据集上表现优异,BART 在基于 SQuAD 的闭卷 QA 基准上仅取得 1.5% 的准确率。
- 当在 500 个段落上微调时,BART 能记忆 66% 的必要事实知识;但当在 5,000 个段落上微调时,该比例骤降至仅 4%,表明存在严重的灾难性遗忘。
- 即使通过 LM-fine-tuning 保留了大部分事实知识,BART 在 QA-fine-tuning 后仍无法回答大多数闭卷问题,表明其在知识利用方面存在根本性困难。
- QA 微调会负面影响模型在复述任务中回忆事实的能力,表明任务特定适应与事实保留之间存在权衡。
- 在测试输入中注入相关段落可提升 BART 的性能,表明外部提示工程可弥补内部知识的缺失。
- 将 LM-fine-tuning 与 QA-fine-tuning 解耦有助于在任务特定微调过程中保留事实性知识,为提升闭卷 QA 性能提供了有前景的路径。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。