[論文レビュー] Massive Editing for Large Language Models via Meta Learning
本稿では、正規方程式を用いて最小二乗問題として解くことで、パラメータシフト集約を定式化する、メタラーニングに基づくMALMENを提案する。これにより、BERT、GPT-2、T5-XL、GPT-Jなど多様な言語モデル(LM)において、数千の事実を同時に効率的かつメモリ効率的に編集可能となり、MEND や MEMIT よりもスケーラビリティと精度で優れる。
While large language models (LLMs) have enabled learning knowledge from the pre-training corpora, the acquired knowledge may be fundamentally incorrect or outdated over time, which necessitates rectifying the knowledge of the language model (LM) after the training. A promising approach involves employing a hyper-network to generate parameter shift, whereas existing hyper-networks suffer from inferior scalability in synchronous editing operation amount. To mitigate the problem, we propose the MAssive Language Model Editing Network (MALMEN), which formulates the parameter shift aggregation as the least square problem, subsequently updating the LM parameters using the normal equation. To accommodate editing multiple facts simultaneously with limited memory budgets, we separate the computation on the hyper-network and LM, enabling arbitrary batch size on both neural networks. Our method is evaluated by editing up to thousands of facts on LMs with different architectures, i.e., BERT-base, GPT-2, T5-XL (2.8B), and GPT-J (6B), across various knowledge-intensive NLP tasks, i.e., closed book fact-checking and question answering. Remarkably, MALMEN is capable of editing hundreds of times more facts than strong baselines with the identical hyper-network architecture and outperforms editor specifically designed for GPT. Our code is available at https://github.com/ChenmienTan/malmen.
研究の動機と目的
- 複数の事実を同時に編集する際の、従来のハイパーネットワークベースの言語モデル編集手法のスケーラビリティ制限を解消すること。
- MEND などの従来手法における勾配蓄積のキャンセル効果と統計的非効率性を克服すること。
- ハイパーネットと言語モデルの計算を分離することで、トレーニング中のメモリ消費量を低減し、任意のバッチサイズを可能にすること。
- 多様な言語モデルおよび知識集約型NLPタスクにおいて、高い編集性能と一般化性能を達成すること。
- 深刻な忘却や再トレーニングなしに、実用的で産業スケールの言語モデル編集を可能にすること。
提案手法
- MALMEN は、複数の事実のパラメータシフト集約を、残差誤差を最小化しキャンセル効果を低減するための最小二乗最適化問題として定式化する。
- 最小二乗問題は正規方程式を用いて解き、すべての注入事実に有効なグローバル最適なパラメータシフトを保証する。
- ハイパーネットと言語モデル間の計算を分離することで、各々のバッチサイズを独立的かつ任意に設定可能とし、メモリ使用量を顕著に削減する。
- ハイパーネットは、標準的な微調整勾配を条件としてパラメータシフトを予測するように訓練され、モデルの一貫性と局所性を維持する。
- 特にキー行列がランク落ちしている場合に一般化性と安定性を向上させるために、最小二乗目的関数に正則化を適用する。
- 答えを生成するトークンのキーと値の勾配のみをキャッシュすることで、1台のA40 GPU上でトレーニングと推論を38.9%高速化できる。
実験結果
リサーチクエスチョン
- RQ1大規模編集におけるパラメータシフト集約を最小二乗問題として定式化することで、キャンセル効果の低減と統計的有意性の向上が可能か?
- RQ2ハイパーネットと言語モデルの計算を分離することで、任意のバッチサイズが可能となり、トレーニング中のメモリ消費量が顕著に削減されるか?
- RQ3MALMEN は、多様な言語モデルおよびタスクにおいて、数千の事実を同時に高精度で編集可能で、一般化性能を達成できるか?
- RQ4閉じたドキュメントの事実チェックおよび質問応答タスクにおいて、MALMEN は MEND や MEMIT よりもスケーラビリティとパフォーマンスで優れているか?
- RQ5MALMEN は再定式化されたプロンプトに対しても一貫性を保っているか、それともトレーニングプロンプト形式を超えた一般化に限界があるか?
主な発見
- MALMEN は、同じハイパーネットアーキテクチャを用いて、MEND よりも最大1,000倍多くの事実を編集可能であり、優れたスケーラビリティを示している。
- GPT-J (6B) において、MALMEN は1,000件の事実編集タスクで99.7%の正確一致(ES)と92.8%の生成スコア(GS)を達成し、MEND や MEMIT を上回った。
- MALMEN は、MEND の勾配蓄積法と比較して、平均残差(MR)を3桁低減し、はるかに少ないキャンセル効果を示している。
- MALMEN のメモリ消費量は編集数の増加に伴いゆっくりと増加するため、1台のA40 GPUで数千件の事実を編集可能である一方、MEND 方式の連結処理は迅速にハードウェア制限に達する。
- 答えに関連するトークンの勾配のみをキャッシュすることで、性能を損なわずにトレーニングおよび推論時間を38.9%短縮できる。
- アブレーションスタディにより、正規方程式と正則化が収束性とパフォーマンスに不可欠であることが確認され、特に行列が特異となるBERT-baseのようなモデルでは顕著である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。