Skip to main content
QUICK REVIEW

[論文レビュー] Task Arithmetic in the Tangent Space: Improved Editing of Pre-Trained Models

Guillermo Ortiz-Jiménez, Alessandro Favero|arXiv (Cornell University)|May 22, 2023
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本論文では、視覚言語モデルの接線空間における線形化を提案し、異なる重み方向が別々の局所的入力領域を制御する重み分離性を強化することで、タスク算術のパフォーマンスを向上させる。接線空間での微調整により、ベンチマーク全体でタスク加算において最大5.8ポイントの精度向上、タスク否定において13.1ポイントの精度低下を達成した。これは、重み分離性が、NTK単体よりも、事前学習モデルにおける有効なタスク算術の鍵であることを示している。

ABSTRACT

Task arithmetic has recently emerged as a cost-effective and scalable approach to edit pre-trained models directly in weight space: By adding the fine-tuned weights of different tasks, the model's performance can be improved on these tasks, while negating them leads to task forgetting. Yet, our understanding of the effectiveness of task arithmetic and its underlying principles remains limited. We present a comprehensive study of task arithmetic in vision-language models and show that weight disentanglement is the crucial factor that makes it effective. This property arises during pre-training and manifests when distinct directions in weight space govern separate, localized regions in function space associated with the tasks. Notably, we show that fine-tuning models in their tangent space by linearizing them amplifies weight disentanglement. This leads to substantial performance improvements across multiple task arithmetic benchmarks and diverse models. Building on these findings, we provide theoretical and empirical analyses of the neural tangent kernel (NTK) of these models and establish a compelling link between task arithmetic and the spatial localization of the NTK eigenfunctions. Overall, our work uncovers novel insights into the fundamental mechanisms of task arithmetic and offers a more reliable and effective approach to edit pre-trained models through the NTK linearization.

研究の動機と目的

  • 事前学習モデルにおけるタスク算術を可能にする根本的メカニズムを理解すること。
  • 非線形モデルにおいても神経接線カーネル(NTK)の制限にもかかわらず、なぜタスク算術が機能するのかを調査すること。
  • 接線空間における線形化微調整を用いて、モデル編集の信頼性とパフォーマンスを向上させること。
  • 重み分離性とNTK固有関数の空間的局在性との間の関係を確立すること。
  • 重み分離性がランダム初期化時には存在しないが、事前学習の過程で出現する、いわゆる「出現的性質」であることを示すこと。

提案手法

  • 著者らは、タスク固有の重み更新の加法的結合を可能にする性質(性質1)としてタスク算術を形式化する。
  • モデルの動的挙動をその接線空間を用いて近似することで、事前学習済み重みの周囲でモデルを線形化する線形化微調整を導入する。
  • 重み分離性は、異なる重み方向が別々の入力領域に独立して影響を与えるかを測る分離誤差指標を用いて定量化される。
  • 線形化モデルにおける機能的分離性と関連づけるために、NTK固有関数の空間的局在性を分析する。
  • CLIP、ConvNeXt、T5-Baseモデルを用いて、視覚および自然言語処理タスクの両方で実験を行い、アーキテクチャおよびモodal に跨る有効性を検証する。
  • VQA、Hateful Memes、IMDB/QASCなどの複数のベンチマークで、非線形および線形化微調整を比較し、タスク加算および否定におけるパフォーマンスを評価する。

実験結果

リサーチクエスチョン

  • RQ1事前学習モデルにおけるタスク算術を可能にする背後にある根本的性質は何か。また、なぜランダム初期化モデルでは失敗するのか。
  • RQ2神経接線カーネル(NTK)は、非線形な事前学習モデルにおけるタスク算術をどの程度説明できるか。
  • RQ3モデルをその接線空間で線形化することで、重み分離性およびタスク算術パフォーマンスにどのような影響を与えるか。
  • RQ4重み分離性は、事前学習の過程で出現する性質であるか。その出現タイミングはいつか。
  • RQ5NTK固有関数の空間的局在性と、モデル重みの機能的分離性との間にどのような関係があるか。

主な発見

  • 線形化微調整は、タスク算術パフォーマンスを顕著に向上させ、タスク加算では非線形微調整と比較して最大5.8ポイントの精度向上、タスク否定では13.1ポイントの精度低下を達成した。
  • 異なる重み方向が別々の入力領域を制御する重み分離性こそが、タスク算術を可能にする鍵であり、NTKそのものではない。
  • 重み分離性は事前学習の過程で出現し、ランダム初期化時には存在しない。これは、事前学習プロセスに起因する出現的性質であることを示している。
  • 事前学習モデルにおけるNTK固有関数の空間的局在性と、機能的分離性の間には相関が見られ、線形化微調整の成功を裏付ける理論的根拠が得られた。
  • 本手法は、アーキテクチャおよびモダリティに跨って一般化可能であり、視覚(CLIP、ConvNeXt)および自然言語処理(T5-Base)モデルの両方で、タスク算術が成功した。
  • ランダム初期化モデルがタスク算術に失敗するのは、学習能力が低いからではなく、重み分離性が欠如しているためであり、単一タスクの精度が中程度に達しても同様の失敗が生じる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。