[论文解读] PMET: Precise Model Editing in a Transformer
PMET 通过同时优化多头自注意力(MHSA)和前馈网络(FFN)的隐藏状态,提出了一种针对 Transformer 模型的精确模型编辑方法,同时仅使用优化后的 FFN 隐藏状态来更新 FFN 权重。该方法提升了编辑的可靠性与特异性,在 counterfact 和 zsRE 基准测试中实现了最先进性能,通过利用 MHSA 作为知识提取器的角色,而无需修改其权重。
Model editing techniques modify a minor proportion of knowledge in Large Language Models (LLMs) at a relatively low cost, which have demonstrated notable success. Existing methods assume Transformer Layer (TL) hidden states are values of key-value memories of the Feed-Forward Network (FFN). They usually optimize the TL hidden states to memorize target knowledge and use it to update the weights of the FFN in LLMs. However, the information flow of TL hidden states comes from three parts: Multi-Head Self-Attention (MHSA), FFN, and residual connections. Existing methods neglect the fact that the TL hidden states contains information not specifically required for FFN. Consequently, the performance of model editing decreases. To achieve more precise model editing, we analyze hidden states of MHSA and FFN, finding that MHSA encodes certain general knowledge extraction patterns. This implies that MHSA weights do not require updating when new knowledge is introduced. Based on above findings, we introduce PMET, which simultaneously optimizes Transformer Component (TC, namely MHSA and FFN) hidden states, while only using the optimized TC hidden states of FFN to precisely update FFN weights. Our experiments demonstrate that PMET exhibits state-of-the-art performance on both the COUNTERFACT and zsRE datasets. Our ablation experiments substantiate the effectiveness of our enhancements, further reinforcing the finding that the MHSA encodes certain general knowledge extraction patterns and indicating its storage of a small amount of factual knowledge. Our code is available at https://github.com/xpq-tech/PMET.
研究动机与目标
- 解决现有模型编辑方法中依赖 Transformer 层(TL)隐藏状态所导致的权重更新不精确问题,这些隐藏状态包含来自 MHSA 和残差连接的无关信息。
- 探究 MHSA 是否存储事实性知识,还是仅编码通用知识提取模式,这将影响其权重是否应被更新。
- 通过解耦 MHSA 和 FFN 隐藏状态的优化,同时保留 MHSA 的结构角色,提升模型编辑的可靠性与特异性。
- 在不修改 MHSA 权重的前提下,实现编辑效果、泛化能力和特异性的最先进性能。
- 通过分析组件级隐藏状态动态,提供更稳健且可解释的大语言模型编辑框架。
提出的方法
- PMET 同时将 MHSA 和 FFN 组件的隐藏状态作为独立优化目标,在 Transformer 层内进行联合优化。
- 仅使用优化后的 FFN 隐藏状态作为目标知识表示,基于最小二乘法对 FFN 权重进行精确更新,避免受到无关 MHSA 或残差信息的污染。
- 基于 MHSA 编码通用知识提取模式的洞察,对 MHSA 隐藏状态进行优化,但不更新其权重,以扩展 FFN 优化的功能空间。
- 采用残差传播策略(平方根传播)将增量权重更新分布至关键层,以在可靠性与模型保持之间取得平衡。
- 引入一种新型损失函数,联合优化 MHSA 和 FFN 隐藏状态,同时保持残差连接流的完整性。
- 该方法避免修改 MHSA 权重,保留其作为知识提取器的角色,仅使用来自 FFN 组件的干净、优化后的表示更新 FFN 权重。
实验结果
研究问题
- RQ1MHSA 是否存储事实性知识,还是主要编码在编辑过程中保持稳定的通用知识提取模式?
- RQ2在不更新其权重的前提下,对 MHSA 隐藏状态进行优化,能否提升 FFN 权重更新的精度与可靠性?
- RQ3残差传播策略的选择(如平方根传播与均匀传播)如何影响编辑可靠性与模型特异性的权衡?
- RQ4与使用完整 TL 隐藏状态的方法相比,解耦 MHSA 和 FFN 隐藏状态优化在多大程度上提升了编辑性能?
- RQ5仅使用优化后的 FFN 隐藏状态进行权重更新,与使用混合或受残差影响的表示相比,其影响如何?
主要发现
- PMET 在 counterfact 和 zsRE 基准测试中均实现了最先进性能,显著优于现有方法,在编辑可靠性与特异性方面表现更优。
- 消融实验表明,同时优化 MHSA 和 FFN 隐藏状态相比仅优化 FFN 隐藏状态,能显著提升可靠性,证实了功能空间扩展的优势。
- 与 FFN 权重同步更新 MHSA 权重可略微提升泛化能力,但会显著损害特异性,表明 MHSA 存储了部分事实性知识,不应被更新。
- 残差更新的均匀传播策略虽能提升模型保持能力(流畅性与特异性),但会大幅降低编辑效能与一致性,凸显信息丢失的风险。
- 平方根传播策略在保持模型完整性与维持更新可靠性之间提供了最佳平衡,在所有关键指标上均优于均匀传播。
- 研究结果证实,MHSA 编码了通用知识提取模式,并存储了少量事实性知识,这为 PMET 中排除 MHSA 权重更新提供了合理依据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。