[论文解读] DyKnow: Dynamically Verifying Time-Sensitive Factual Knowledge in LLMs
该论文提出了DyKnow,一种动态基准测试方法,通过在评估时实时查询Wikidata来检测大语言模型中过时的时间敏感事实知识,揭示了大多数模型(包括GPT-J和Llama-2)仍保留过时的事实。该研究评估了知识编辑方法与检索增强生成(RAG),发现RAG在对齐方面表现优于编辑技术,但无法修正模型权重;而编辑方法则表现出有限的可扩展性与强烈的模型依赖性。
LLMs acquire knowledge from massive data snapshots collected at different timestamps. Their knowledge is then commonly evaluated using static benchmarks. However, factual knowledge is generally subject to time-sensitive changes, and static benchmarks cannot address those cases. We present an approach to dynamically evaluate the knowledge in LLMs and their time-sensitiveness against Wikidata, a publicly available up-to-date knowledge graph. We evaluate the time-sensitive knowledge in twenty-four private and open-source LLMs, as well as the effectiveness of four editing methods in updating the outdated facts. Our results show that 1) outdatedness is a critical problem across state-of-the-art LLMs; 2) LLMs output inconsistent answers when prompted with slight variations of the question prompt; and 3) the performance of the state-of-the-art knowledge editing algorithms is very limited, as they can not reduce the cases of outdatedness and output inconsistency.
研究动机与目标
- 为解决大语言模型中过时的时间敏感事实知识检测的关键缺口,特别是过时事实的'什么'和'何时'问题。
- 开发一种动态基准测试,通过在评估时从Wikidata实时检索最新答案,避免基准本身过时。
- 评估知识编辑技术与RAG作为对齐大语言模型与当前事实知识的替代方法的有效性。
- 通过分析模型对时间敏感查询的事实性回答,估算大语言模型训练数据的最近时间。
- 通过共享代码、数据集与评估脚本,使社区能够将基准扩展至新领域。
提出的方法
- DyKnow在评估时动态从Wikidata检索当前事实答案,利用唯一标识符与属性提取每条事实的时间戳响应。
- 该基准聚焦于政治(47个国家)、体育(28名运动员)和组织(23位首席执行官/秘书长)中的时间敏感事实,使用词汇化提示进行模型评估。
- 通过将模型输出与实时Wikidata答案对比来识别过时知识,性能通过各领域内的精确匹配与调和平均值进行衡量。
- 将知识编辑方法(ROME、MEMIT、SERAC、IKE)应用于四个选定的大语言模型,以纠正过时事实,并在相同基准上评估其性能。
- 使用检索增强生成(RAG)作为对齐方法的替代方案,检索当前事实并提示模型生成更新后的响应。
- 通过增加编辑数量来评估编辑方法的可扩展性,测量GPT-2 XL与Llama-2 Chat等模型的性能退化情况。
实验结果
研究问题
- RQ1大语言模型中时间敏感事实知识的多大比例是过时的?其用于预训练/微调的数据是在何时收集的?
- RQ2最先进的知识编辑方法在纠正大语言模型中真实世界的时间敏感事实方面有多有效?
- RQ3RAG能否作为知识编辑的可靠替代方案,以使大语言模型与当前事实知识对齐?
- RQ4不同大语言模型架构中,编辑方法的性能如何随编辑数量的增加而变化?
- RQ5当前编辑与基于检索的对齐技术在保持大语言模型知识更新方面存在哪些局限性?
主要发现
- GPT-J、Llama-2、Falcon与Bloom在回答Cristiano Ronaldo俱乐部历史时返回了过时信息,其中GPT-J在2021年发布时错误地声称其‘效力于皇家马德里’。
- 如GPT-3与Vicuna等模型在发布时初始正确,但随时间推移逐渐过时,表明其存在部署后的知识衰减现象。
- 随着编辑数量增加,ROME与SERAC的性能出现下降,表明其在大规模知识更新中可扩展性有限。
- IKE在GPT-J与Mistral Instruct上表现优异,表明上下文学习对特定模型有效,但未能纠正所有过时事实。
- RAG在Mistral Instruct上实现了超过80%的对齐性能,且在部分模型上优于编辑方法,但其无法修正模型内部知识。
- MEMIT在Llama-2 Chat上不同编辑数量下表现稳定,而ROME与SERAC则随着编辑数量增加性能持续下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。