[论文解读] Detoxifying Large Language Models via Knowledge Editing
本文提出DINM,一种知识编辑方法,通过利用上下文语义和术中神经监测,直接定位并修改大语言模型中的毒性区域,实现强效去毒化,同时性能退化最小。该方法证明,DINM显著提升了对分布外对抗性提示的泛化能力——在LLaMA2-7B-Chat上成功率从43.51%提升至86.74%,在Mistral-7B-v0.1上从47.30%提升至96.84%,且仅需一个微调实例,无需额外训练。
This paper investigates using knowledge editing techniques to detoxify Large Language Models (LLMs). We construct a benchmark, SafeEdit, which covers nine unsafe categories with various powerful attack prompts and equips comprehensive metrics for systematic evaluation. We conduct experiments with several knowledge editing approaches, indicating that knowledge editing has the potential to detoxify LLMs with a limited impact on general performance efficiently. Then, we propose a simple yet effective baseline, dubbed Detoxifying with Intraoperative Neural Monitoring (DINM), to diminish the toxicity of LLMs within a few tuning steps via only one instance. We further provide an in-depth analysis of the internal mechanism for various detoxifying approaches, demonstrating that previous methods like SFT and DPO may merely suppress the activations of toxic parameters, while DINM mitigates the toxicity of the toxic parameters to a certain extent, making permanent adjustments. We hope that these insights could shed light on future work of developing detoxifying approaches and the underlying knowledge mechanisms of LLMs. Code and benchmark are available at https://github.com/zjunlp/EasyEdit.
研究动机与目标
- 解决对齐的LLM在经过安全微调后仍易受对抗性提示影响而生成有害输出的脆弱性。
- 探究知识编辑是否可通过修改毒性参数区域,实现对LLM的精确、高效且永久的去毒化。
- 构建一个基准测试集SafeEdit,涵盖九类不安全内容及对抗性攻击模板,以系统评估去毒化方法。
- 分析不同去毒化方法的内部机制,尤其区分毒性激活的抑制与毒性区域的永久性修改。
- 证明基于位置感知的毒性区域编辑可带来比激活抑制更稳健、更具泛化能力的安全改进。
提出的方法
- 提出DINM(术中神经监测去毒化),一种利用对抗性输入的上下文语义识别LLM中毒性区域的方法。
- 使用在Jigsaw数据集上训练的毒性探测器,通过测量模型参数与探测器权重之间的余弦相似度来量化毒性。
- 应用知识编辑技术直接修改识别出的毒性区域内的参数,旨在擦除毒性而非抑制激活。
- 仅使用一个对抗性实例进行编辑,实现高效、少步数微调,无需完整微调。
- 通过可视化中间层表示(hℓ_mid)中的激活变化,分析SFT与DPO如何改变信息流向毒性区域。
- 引入一个评估框架,采用三项指标衡量去毒化效果:防御成功率、对分布外输入的泛化能力,以及性能保留程度。
实验结果
研究问题
- RQ1知识编辑技术是否能通过修改特定毒性参数区域而非抑制激活,实现对LLM的有效且永久的去毒化?
- RQ2去毒化模型在多样化的、分布外的对抗性提示下的泛化性能如何变化?
- RQ3精确的毒性区域定位对去毒化效果和鲁棒性有何影响?
- RQ4传统方法如SFT和DPO在内部机制上与DINM相比,如何在缓解毒性方面存在差异?
- RQ5单个编辑实例的质量在多大程度上影响去毒化模型的一致性与性能?
主要发现
- DINM在LLaMA2-7B-Chat上将泛化去毒成功率从43.51%提升至86.74%,在Mistral-7B-v0.1上从47.30%提升至96.84%,证明其对分布外对抗性输入具有强大泛化能力。
- DINM仅需一个微调实例且无需额外训练,展现出极高的效率。
- 当使用不同编辑实例时,性能表现出显著差异,部分指标标准差高达4.63,表明对实例质量敏感。
- DINM永久修改毒性区域,而SFT和DPO主要通过抑制毒性激活来作用,未改变底层毒性参数。
- 激活变化分析显示,DPO和SFT通过将信息流从毒性区域引导至其他路径来实现缓解,而DINM则直接改变毒性参数本身,从而实现更稳健的去毒化。
- 毒性区域的精确定位是去毒化成功的关键因素,缺乏精确定位的模型无法有效实现泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。