Skip to main content
QUICK REVIEW

[論文レビュー] Aging with GRACE: Lifelong Model Editing with Discrete Key-Value Adaptors

Thomas Hartvigsen, Swami Sankaranarayanan|arXiv (Cornell University)|Nov 20, 2022
Topic Modeling被引用数 15
ひとこと要約

GRACEは、微調整や重み更新なしで、数千回に及ぶ連続的かつ標的的な編集を事前学習された言語モデルに施すことができる生涯学習型のモデル編集フレームワークである。潜在空間に離散的キー・バリュー・アダプタを用いて補正をキャッシュ・リトリーブし、最小限の性能低下と優れた一般化性能を達成することで、最先端の性能を実現している。

ABSTRACT

Deployed language models decay over time due to shifting inputs, changing user needs, or emergent world-knowledge gaps. When such problems are identified, we want to make targeted edits while avoiding expensive retraining. However, current model editors, which modify such behaviors of pre-trained models, degrade model performance quickly across multiple, sequential edits. We propose GRACE, a lifelong model editing method, which implements spot-fixes on streaming errors of a deployed model, ensuring minimal impact on unrelated inputs. GRACE writes new mappings into a pre-trained model's latent space, creating a discrete, local codebook of edits without altering model weights. This is the first method enabling thousands of sequential edits using only streaming errors. Our experiments on T5, BERT, and GPT models show GRACE's state-of-the-art performance in making and retaining edits, while generalizing to unseen inputs. Our code is available at https://www.github.com/thartvigsen/grace}.

研究の動機と目的

  • 微調整が不可能な実世界の設定において、継続的かつ標的的な事前学習言語モデルの編集を実現する課題に対処すること。
  • 特に単一のストリーミングエラー例しか利用できない状況において、順次編集における性能低下や忘却を克服すること。
  • 元のモデル動作を保持しつつ、事実の錯覚やラベルシフトに対するスポット修復を可能にする、パラメータ効率的かつモデルに依存しない手法を開発すること。
  • 永続的なコードブックによるキー・バリューのマッピングを介して編集をモデル重みから分離することで、編集の透明性と追跡可能性を実現すること。
  • 生涯学習型モデル編集という、これまであまり研究が進んでいなかった問題設定のためのベンチマークとメトリクスを確立すること。

提案手法

  • GRACEは、事前学習されたトランスフォーマー・モデルの所定の層にプラグイン型アダプタを導入し、モデルの凍結された重みを変更せずにレイヤー間の変換を修正する。
  • 特定のエラーとされる入力埋め込みをキャッシュし、それに対応する値ベクトルを学習することで、編集のための離散的コードブックを形成する。
  • 編集は、キャッシュされたキーのεボール内にある入力にのみ適用され、潜在空間における意味的類似性を介して局所性と一般化を確保する。
  • 時間経過に伴いεボールのサイズを動的に管理することで、即時の補正と過去の編集の長期的保持のバランスを取る。
  • GRACEは最小限の推論オーバーヘッドで動作し、自己回帰的および非自己回帰的モデルの両方と互換性がある。
  • コードブックは完全に確認可能であり、監査可能性と透明性を提供する。重み編集手法とは異なり、変更内容が見えにくくなることはない。

実験結果

リサーチクエスチョン

  • RQ1モデル編集手法は、微調整や重み更新なしで数千回の連続的編集を経ても性能を維持できるか?
  • RQ2個々の例の記憶を避けて、未観測の入力に対しても編集を一般化できるか?
  • RQ3実世界の展開環境において、事実の錯覚やラベルシフトを高精度で是正できるか?
  • RQ4編集に利用可能なのが単一の孤立したエラー例のみの場合、手法の性能はいかがなものか?
  • RQ5長期間にわたる編集の連続に対して、元のモデルの能力を保持しつつ、推論コストを最小限に抑えることができるか?

主な発見

  • GRACEは、質問応答、ドキュメント分類、言語生成のタスクにおいて、T5、BERT、GPTモデルの3つすべてで、7つの最先端のベースラインを上回る生涯学習編集性能を達成した。
  • GRACEは、以前に編集された入力においても高い性能を維持し、未観測の入力に対しても一般化が可能であり、過学習や記憶の兆候を示さない。
  • GRACEは、最大約5,000回の編集にわたるシーケンスにおいても安定した性能を示し、長期的な展開環境における耐久性を実証した。
  • 潜在空間における効率的な類似度探索のおかげで、長期間にわたる編集シーケンスにおいても推論時間への影響はわずかで、一度限りのコストに抑えられる。
  • 手法は新しい入力に対しても効果的に一般化され、正確な入力一致ではなく意味的類似性に基づいて編集が適用される。
  • GRACEのコードブックは透明で確認可能であり、編集履歴の追跡が可能である。重みベースの編集手法とは異なり、変更内容が見えにくくなることはない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。