Skip to main content
QUICK REVIEW

[论文解读] DocTER: Evaluating Document-based Knowledge Editing

Suhang Wu, Wang, Ante|arXiv (Cornell University)|Aug 19, 2023
Topic Modeling被引用 4
一句话总结

本文提出 Eva-KELLM,一种基于原始文档而非事实三元组的新基准,用于评估大语言模型(LLMs)中的知识编辑。该框架评估编辑效果、无关知识保留、基于修改事实的推理能力以及跨语言迁移能力,揭示了尽管直接编辑能力有所提升,但当前方法在推理和多语言泛化方面仍存在显著不足。

ABSTRACT

Knowledge editing aims to correct outdated or inaccurate knowledge in neural networks. In this paper, we explore knowledge editing using easily accessible documents instead of manually labeled factual triples employed in earlier research. To advance this field, we establish the first evaluation benchmark, extit{DocTER}, featuring Documents containing counterfactual knowledge for editing. A comprehensive four-perspective evaluation is introduced: Edit Success, Locality, Reasoning, and Cross-lingual Transfer. To adapt conventional triplet-based knowledge editing methods for this task, we develop an Extract-then-Edit pipeline that extracts triples from documents before applying existing methods. Experiments on popular knowledge editing methods demonstrate that editing with documents presents significantly greater challenges than using triples. In document-based scenarios, even the best-performing in-context editing approach still lags behind by 10 points in editing success when compared to using gold triples. This observation also holds for both reasoning and cross-lingual test sets. We further analyze key factors influencing task performance, including the quality of extracted triples, the frequency and position of edited knowledge in documents, various methods for enhancing reasoning, and performance differences across various directions in cross-lingual knowledge editing, which provide valuable insights for future research.

研究动机与目标

  • 解决现有知识编辑基准依赖于成本高、范围窄的事实三元组所带来的局限性。
  • 开发一种更实用且通用的评估框架,使用原始文档作为编辑输入。
  • 全面评估 LLM 不仅在直接编辑成功方面,还包括基于修改知识的推理能力与跨语言迁移能力。
  • 识别当前知识编辑方法中的关键差距,特别是在推理能力和多语言能力方面。

提出的方法

  • 该基准使用原始文档作为知识编辑的输入,相较于基于三元组的方法,提供了更自然且可扩展的途径。
  • 它从四个维度评估 LLM:直接知识编辑评估(DKEE)、无关知识保留评估(UKRE)、用于推理的间接知识编辑评估(IKEE)以及用于多语言迁移的跨语言知识编辑评估(CKEE)。
  • 该框架采用基于概率的评分方法,衡量模型对原始事实与编辑后事实的信心程度,确保可量化的评估。
  • 通过 LoRA 微调特定层(如 MLP 和自注意力层),分析参数级别变化对编辑性能的影响。
  • 数据集构建包含多样化的事实编辑、推理问题以及跨语言查询对,以支持全面评估。
  • 实验对比了在不同模型组件(MLP、自注意力)上进行 LoRA 微调的方法,以分离出有效的编辑策略。

实验结果

研究问题

  • RQ1使用原始文档进行知识编辑是否能实现比基于三元组的方法更高的有效性与更广的适用性?
  • RQ2经过编辑的 LLM 在多大程度上能正确运用新插入的知识进行推理,而非仅仅记忆?
  • RQ3当前编辑方法在跨语言设置下的泛化能力如何,即当查询语言与训练文档语言不同时?
  • RQ4特定模型层在成功知识编辑中扮演什么角色?哪些层在参数调整方面最为有效?

主要发现

  • +LoRA(自注意力+MLP) 方法将 BLOOM-3B 模型的 ES 得分从 23.88 提升至 44.33,表明在直接编辑方面取得显著进展,但代价是无关知识保留能力下降。
  • UKRE 指标显示,DKEE 性能的提升通常伴随着无关知识保留能力的下降,凸显了这一关键权衡。
  • 基于修改知识的推理能力依然薄弱:BLOOM-7.1B 模型的最高 IKEE 准确率为 48.00,表明编辑后的事实与推理过程整合得较差。
  • 跨语言知识迁移能力严重受限,CES 得分显著低于 ES 得分,表明在非目标语言上的泛化能力极差。
  • 模型中间层(第 11–20 层)在编辑中最有效,+LoRA(MLP 11–20) 和 +LoRA(自注意力 11–20) 在所有层组中表现最佳。
  • 更大的模型(BLOOM-7.1B)相比更小的模型(BLOOM-3B)从编辑方法中获得了更大的性能提升,表明模型规模有助于提升可编辑性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。