[論文レビュー] Dataless Knowledge Fusion by Merging Weights of Language Models
本稿では、予測の差異をパラメータ空間で最小化することで、閉形式解を用いて微調整済み言語モデルを統合するデータ不要なモデル統合手法である Regression Mean (RegMean) を提案する。Fisher重み付き平均やアンサンブルなどのベースラインを著しく上回り、トレーニングデータを必要とせずにドメイン内およびドメイン外の一般化性能が優れている。
Fine-tuning pre-trained language models has become the prevalent paradigm for building downstream NLP models. Oftentimes fine-tuned models are readily available but their training data is not, due to data privacy or intellectual property concerns. This creates a barrier to fusing knowledge across individual models to yield a better single model. In this paper, we study the problem of merging individual models built on different training data sets to obtain a single model that performs well both across all data set domains and can generalize on out-of-domain data. We propose a dataless knowledge fusion method that merges models in their parameter space, guided by weights that minimize prediction differences between the merged model and the individual models. Over a battery of evaluation settings, we show that the proposed method significantly outperforms baselines such as Fisher-weighted averaging or model ensembling. Further, we find that our method is a promising alternative to multi-task learning that can preserve or sometimes improve over the individual models without access to the training data. Finally, model merging is more efficient than training a multi-task model, thus making it applicable to a wider set of scenarios.
研究の動機と目的
- プライバシーまたは知的財産の制約によりトレーニングデータが入手できない状況で、複数の微調整済み言語モデルからの知識統合の課題に対処すること。
- 再トレーニングや元のデータへのアクセスが不要なパラメータ空間でのモデル統合を計算的に効率的に行う手法を開発すること。
- 多様なデータセットで訓練されたモデルを統合することで、ドメイン内性能とドメイン外一般化性能を向上させること。
- データへのアクセスが制限される状況において、マルチタスク学習のスケーラブルな代替手段を提供し、性能を保持または向上させること。
- 実世界のNLPデプロイメント環境における知識統合として、モデル統合の実用性と利点を実証すること。
提案手法
- 最適線形回帰にインspiredされた、パラメータ空間における予測差異を最小化する新しいモデル統合アルゴリズム RegMean を提案する。
- モデルパラメータ上の重み付き最小二乗最適化として統合問題を定式化し、反復的トレーニングを回避する閉形式解を導出する。
- ドメイン内およびドメイン外の少数の例を用いてフィッシャー情報行列を推定し、統合性能を向上させる。
- 同一アーキテクチャおよび事前学習済み重みを持つ複数の微調整済みモデル(例:RoBERTa, T5, DeBERTa)を統合する。
- モデル間の重みを整列させるための順列マッチング技術を適用し、統合品質を向上させる。
- 複数のモデルタイプおよびデータ分布における統合効率とパラメータ効率を評価する。
実験結果
リサーチクエスチョン
- RQ1トレーニングデータが入手できない状況で、パラメータ空間におけるモデル統合がアンサンブルや単純平均よりも優れた性能を達成できるか?
- RQ2提案された RegMean 法が、個々の微調整済みモデルと比較して、ドメイン外データにおける一般化性能を向上させるか?
- RQ3多様なNLPタスクおよびデータセットにおいて、RegMean の性能は Fisher重み付き平均や他の統合ベースラインと比べてどうなるか?
- RQ4プライベートまたは特許を取得したトレーニングデータがある状況において、データ不要統合がマルチタスク学習の実用的代替手段としてどの程度有効か?
- RQ5ドメイン内例の少数(例:10~50個)を用いてフィッシャー情報行列を推定する場合、統合性能およびデータ漏洩リスクにどのような影響があるか?
主な発見
- RegMean は、ドメイン内およびドメイン外一般化を含むすべての評価設定で、Fisher重み付き平均やモデルアンサンブルを著しく上回る。
- 統合モデルは、ドメイン外データにおいて、最も優れた個々のモデルよりも高い性能を達成しており、強力な一般化能力を示している。
- RegMean は高い推論速度を維持し、追加のパラメータオーバーヘッドが最小限であるため、スクラッチからマルチタスクモデルをトレーニングするのよりも効率的である。
- フィッシャー情報の推定に限られたドメイン内例(例:10~50個)を使用しても、モデルは頑健であり、データ依存性が低下する。
- RegMean を用いたモデル統合は、RoBERTa や T5、DeBERTa など多様なアーキテクチャおよびタスクで性能を保持または向上させ、広範な適用可能性を示している。
- 本手法により、プライベートデータで訓練されたモデル間での知識統合が可能となり、データ制限環境におけるマルチタスク学習の実用的代替手段を提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。