Skip to main content
QUICK REVIEW

[論文レビュー] Detoxifying Large Language Models via Knowledge Editing

Mengru Wang, Ningyu Zhang|arXiv (Cornell University)|Mar 21, 2024
Natural Language Processing Techniques被引用数 4
ひとこと要約

本稿では、文脈的意味と術中ニューラルモニタリングを用いて、毒性領域を直接標的にし、その修正を行う知識編集手法DINMを提案する。この手法により、性能劣化を最小限に抑えつつ強力なデトックス化を達成する。DINMは、分布外の悪意あるプロンプトに対する一般化性能を顕著に向上させ、LLaMA2-7B-Chatでは成功率を43.51%から86.74%へ、Mistral-7B-v0.1では47.30%から96.84%へと向上させる。また、1つのチューニングインスタンスと追加学習を必要としない。

ABSTRACT

This paper investigates using knowledge editing techniques to detoxify Large Language Models (LLMs). We construct a benchmark, SafeEdit, which covers nine unsafe categories with various powerful attack prompts and equips comprehensive metrics for systematic evaluation. We conduct experiments with several knowledge editing approaches, indicating that knowledge editing has the potential to detoxify LLMs with a limited impact on general performance efficiently. Then, we propose a simple yet effective baseline, dubbed Detoxifying with Intraoperative Neural Monitoring (DINM), to diminish the toxicity of LLMs within a few tuning steps via only one instance. We further provide an in-depth analysis of the internal mechanism for various detoxifying approaches, demonstrating that previous methods like SFT and DPO may merely suppress the activations of toxic parameters, while DINM mitigates the toxicity of the toxic parameters to a certain extent, making permanent adjustments. We hope that these insights could shed light on future work of developing detoxifying approaches and the underlying knowledge mechanisms of LLMs. Code and benchmark are available at https://github.com/zjunlp/EasyEdit.

研究の動機と目的

  • 安全な微調整が施された対話型LLMが、有害な出力を引き起こす悪意あるプロンプトに対して脆弱であるという問題に対処すること。
  • 知識編集が、毒性パラメータ領域を直接修正することで、正確で効率的かつ恒久的なLLMのデトックス化を可能にするかを調査すること。
  • 9つの危険なカテゴリをカバーし、悪意ある攻撃テンプレートを含むベンチマークSafeEditを構築すること。
  • 異なるデトックス化手法の内部メカニズムを分析し、特に、毒性活性の抑制と毒性領域の恒久的変更の違いを明確にすること。
  • 毒性領域の位置に配慮した編集が、活性の抑制よりもより強固で一般化可能な安全性向上をもたらすことを示すこと。

提案手法

  • 悪意ある入力からの文脈的意味を用いて、LLM内の毒性領域を特定する手法であるDINM(術中ニューラルモニタリングを用いたデトックス化)を提案する。
  • Jigsawデータセットで事前学習された毒性プローブを用い、モデルパラメータとプローブの重みとのコサイン類似度を測定することで、毒性を定量化する。
  • 識別された毒性領域内のパラメータを直接修正する知識編集を適用し、活性の抑制ではなく毒性そのものを消去することを目的とする。
  • 1つの悪意あるインスタンスを用いて編集を実行することで、フルファインチューニングを必要とせず、少数ステップでのチューニングが可能になる。
  • 中間層表現(hℓ_mid)における活性化シフトを可視化し、SFTとDPOが毒性領域への情報フローにどのように影響を与えるかを分析する。
  • 防御成功、OOD入力への一般化、一般性能の保持の3つの指標を用いて、デトックス化の評価フレームワークを導入する。

実験結果

リサーチクエスチョン

  • RQ1知識編集技術は、活性の抑制ではなく特定の毒性パラメータ領域を直接修正することで、LLMの効果的かつ恒久的なデトックス化を可能にするか?
  • RQ2多様で分布外の悪意あるプロンプトに対して、デトックス化されたモデルの一般化性能はどのように変化するか?
  • RQ3正確な毒性領域の局在化が、デトックス化の効果性と強度に与える影響は何か?
  • RQ4SFTやDPOといった従来手法は、DINMと比較して毒性緩和の内部メカニズムでどのように異なるか?
  • RQ51つの編集インスタンスの品質が、デトックス化モデルの一貫性と性能に及ぼす影響はどの程度か?

主な発見

  • DINMは、LLaMA2-7B-Chatで一般化デトックス成功率を43.51%から86.74%へ、Mistral-7B-v0.1では47.30%から96.84%へと向上させ、OOD悪意ある入力への一般化性能が顕著に向上した。
  • DINMは1つのチューニングインスタンスと追加学習を必要とせず、非常に効率的である。
  • 異なる編集インスタンスを用いた場合、性能に顕著なばらつきが見られ、一部の指標で標準偏差が最大4.63に達するなど、インスタンス品質に敏感であることが示された。
  • DINMは毒性領域を恒久的に修正するが、SFTやDPOは主に毒性活性を抑制するだけで、根本的な毒性パラメータの変更は行わない。
  • 活性化シフト分析から、DPOとSFTは情報フローを毒性領域から回避するのに対し、DINMは毒性パラメータ自体を変更するため、より強固なデトックス化が達成される。
  • 毒性領域の局在化はデトックス化成功の重要な要因であり、正確な局在化が行われないモデルは、効果的な一般化を達成できない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。