[论文解读] Massive Editing for Large Language Models via Meta Learning
该论文提出 MALMEN,一种基于元学习的大规模、可扩展语言模型编辑方法,通过将参数偏移聚合建模为通过正规方程求解的最小二乘问题,实现对 BERT、GPT-2、T5-XL 和 GPT-J 等多种大语言模型的数千条事实的高效、内存高效的同步编辑,其在可扩展性和准确性方面均优于先前的 MEND 和 MEMIT 方法。
While large language models (LLMs) have enabled learning knowledge from the pre-training corpora, the acquired knowledge may be fundamentally incorrect or outdated over time, which necessitates rectifying the knowledge of the language model (LM) after the training. A promising approach involves employing a hyper-network to generate parameter shift, whereas existing hyper-networks suffer from inferior scalability in synchronous editing operation amount. To mitigate the problem, we propose the MAssive Language Model Editing Network (MALMEN), which formulates the parameter shift aggregation as the least square problem, subsequently updating the LM parameters using the normal equation. To accommodate editing multiple facts simultaneously with limited memory budgets, we separate the computation on the hyper-network and LM, enabling arbitrary batch size on both neural networks. Our method is evaluated by editing up to thousands of facts on LMs with different architectures, i.e., BERT-base, GPT-2, T5-XL (2.8B), and GPT-J (6B), across various knowledge-intensive NLP tasks, i.e., closed book fact-checking and question answering. Remarkably, MALMEN is capable of editing hundreds of times more facts than strong baselines with the identical hyper-network architecture and outperforms editor specifically designed for GPT. Our code is available at https://github.com/ChenmienTan/malmen.
研究动机与目标
- 为解决现有基于超网络的语言模型编辑方法在同步编辑多条事实时的可扩展性限制。
- 克服 MEND 等先前方法中梯度累积带来的抵消效应和统计效率低下问题。
- 通过解耦超网络与语言模型的计算,降低训练期间的显存消耗,实现任意批量大小。
- 在多种大语言模型和知识密集型自然语言处理任务中实现高编辑性能与泛化能力。
- 实现在不发生灾难性遗忘或重新训练的前提下,对语言模型进行实际的、工业规模的编辑。
提出的方法
- MALMEN 将多条事实的参数偏移聚合建模为最小二乘优化问题,以最小化残差误差并减少抵消效应。
- 通过正规方程求解最小二乘问题,确保获得全局最优的参数偏移,从而在所有注入的事实中均有效。
- 该方法解耦了超网络与语言模型之间的计算,使两者可独立设置批量大小,显著降低显存使用。
- 超网络被训练为基于标准微调梯度预测参数偏移,以保持模型一致性与局部性。
- 在最小二乘目标函数中引入正则化,以提升泛化能力与稳定性,尤其在关键矩阵秩亏时表现更优。
- 该方法仅缓存生成答案的标记对应的键和值梯度,使单张 A40 GPU 上的训练与推理速度提升 38.9%。
实验结果
研究问题
- RQ1大规模编辑的参数偏移聚合能否被建模为最小二乘问题,以减少抵消效应并提升统计显著性?
- RQ2通过解耦超网络与语言模型的计算,能否实现任意批量大小并显著降低训练期间的显存消耗?
- RQ3MALMEN 能否在高准确率和泛化能力下,同时编辑数千条事实,并适用于多种大语言模型和任务?
- RQ4在封闭书事实核查与问答任务中,MALMEN 与 MEND 和 MEMIT 相比,在可扩展性与性能方面表现如何?
- RQ5MALMEN 在改写后的提示中是否保持一致性?其泛化能力是否受限于训练时的提示格式?
主要发现
- MALMEN 使用相同的超网络架构,可编辑的事实数量是 MEND 的 1,000 倍,展现出更优的可扩展性。
- 在 GPT-J(6B)上,MALMEN 在 1,000 条事实的编辑任务中实现了 99.7% 的精确匹配(ES)和 92.8% 的生成得分(GS),优于 MEND 和 MEMIT。
- 与 MEND 的梯度累积方法相比,MALMEN 将平均残差(MR)降低了三个数量级,表明其抵消效应显著减弱。
- MALMEN 的显存消耗随编辑数量增长缓慢,使其可在单张 A40 GPU 上编辑数千条事实,而 MEND 式的拼接方法会迅速超出硬件限制。
- 仅缓存与答案相关的标记可使训练与推理时间减少 38.9%,且不损失性能。
- 消融实验表明,正规方程与正则化对收敛与性能至关重要,尤其在 BERT-base 等矩阵奇异问题突出的模型上。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。