[论文解读] Cross-Lingual Knowledge Editing in Large Language Models
本文研究了多语言大语言模型(LLMs)中的跨语言知识编辑问题,通过将英语知识编辑示例翻译为中文,提出了一项基于双语ZsRE的基准数据集(Bi-ZsRE)。在LLaMA、LLaMA2和Baichuan模型上评估了多种编辑方法,发现一种语言中的知识编辑在另一语言中难以有效迁移,跨语言泛化性和局部性表现显著下降,表明在多语言模型中保持一致行为面临重大挑战。
Knowledge editing aims to change language models' performance on several special cases (i.e., editing scope) by infusing the corresponding expected knowledge into them. With the recent advancements in large language models (LLMs), knowledge editing has been shown as a promising technique to adapt LLMs to new knowledge without retraining from scratch. However, most of the previous studies neglect the multi-lingual nature of some main-stream LLMs (e.g., LLaMA, ChatGPT and GPT-4), and typically focus on monolingual scenarios, where LLMs are edited and evaluated in the same language. As a result, it is still unknown the effect of source language editing on a different target language. In this paper, we aim to figure out this cross-lingual effect in knowledge editing. Specifically, we first collect a large-scale cross-lingual synthetic dataset by translating ZsRE from English to Chinese. Then, we conduct English editing on various knowledge editing methods covering different paradigms, and evaluate their performance in Chinese, and vice versa. To give deeper analyses of the cross-lingual effect, the evaluation includes four aspects, i.e., reliability, generality, locality and portability. Furthermore, we analyze the inconsistent behaviors of the edited models and discuss their specific challenges. Data and codes are available at https://github.com/krystalan/Bi_ZsRE
研究动机与目标
- 研究在多语言大语言模型中,于一种语言中进行编辑但在另一种语言中进行评估时的跨语言影响。
- 检验现有知识编辑方法是否能有效实现多语言大语言模型(如LLaMA、LLaMA2和Baichuan)中知识编辑的跨语言迁移。
- 分析编辑后模型在不同语言中的可靠性、泛化性、局部性和可移植性,识别跨语言行为中的一致性问题与挑战。
- 通过将原始ZsRE数据集从英语翻译为中文,构建大规模双语知识编辑数据集(Bi-ZsRE),以支持系统性评估。
提出的方法
- 作者使用最先进的大语言模型(如ChatGPT和GPT-4)自动将ZsRE数据集从英语翻译为中文,构建名为Bi-ZsRE的双语数据集。
- 在多语言大语言模型上评估七种知识编辑方法——涵盖基于记忆的方法(SERAC、MEMIT)、元学习方法(MEND、IKE)以及定位后编辑方法(ROME、KN、FT)。
- 评估聚焦于四个维度:可靠性(正确性)、泛化性(对改写提示的性能)、局部性(对范围外事实的保留)和可移植性(对基于推理问题的泛化能力)。
- 为评估跨语言迁移,模型在英语中进行编辑并在中文中进行评估,反之亦然,采用严格和宽松的评估设置以应对语言不匹配问题。
- 宽松评估设置允许在评分目标语言查询时同时接受英语和中文的正确答案,从而减轻语言不匹配的影响。
- 实验在中文-LLaMA-2-7B及其他多语言大语言模型上进行,定量指标包括在编辑语言和评估语言上的F1和EM分数。
实验结果
研究问题
- RQ1在一种语言中(如英语)进行的知识编辑是否能成功迁移到另一种语言(如中文)?
- RQ2知识编辑方法在不同语言中的可靠性、泛化性、局部性和可移植性表现如何变化?
- RQ3在一种语言中进行编辑在多大程度上影响模型在其他语言中的行为,特别是局部性和非预期知识变化方面?
- RQ4语言之间语言建模能力的差距在多大程度上影响知识编辑的效率和有效性?
- RQ5在跨语言知识编辑中存在哪些具体挑战和不一致行为,特别是在知识迁移和语言不匹配方面?
主要发现
- 在一种语言中进行的知识编辑在其他语言中迁移效果极差:SERAC(En)在英语泛化性上得分为83.64 F1,但在中文中仅得28.46 F1;而SERAC(Zh)在中文中得分为67.93 F1,但在英文中仅得15.00 F1。
- 编辑方法的跨语言泛化性受到显著限制,大多数方法在非编辑语言中评估时性能下降超过50%。
- 在一种语言中进行编辑会影响其他语言的局部性——例如,MEND(En)在英语局部性上得分为90.50 F1,在中文中为89.75 F1,表明存在跨语言干扰。
- 可移植性表现普遍极低,表明大多数方法仅记忆表面文本形式而非内化语义知识。
- 语言不匹配显著影响评估结果:当放宽正确答案标准,允许同时接受源语言和目标语言答案时,泛化得分略有提升,证实语言不匹配是真实但次要的混淆因素。
- IKE表现出高可靠性,但局部性差(如中文局部性得分为89.74 F1),表明存在非预期知识变化的风险,尤其在局部性较低的方法中更为明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。