Skip to main content
QUICK REVIEW

[논문 리뷰] Task Arithmetic in the Tangent Space: Improved Editing of Pre-Trained Models

Guillermo Ortiz-Jiménez, Alessandro Favero|arXiv (Cornell University)|2023. 05. 22.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

이 논문은 사전 훈련된 비전-언어 모델의 탄성 공간에서 선형화함으로써 가중치 분리도를 증폭시켜 작업 산술 성능을 향상시키는 방법을 제안한다. 여기서 서로 다른 가중치 방향이 개별적이고 국소적인 입력 영역을 제어한다. 사전 훈련된 가중치 주변에서 탄성 공간에서 미세조정을 수행함으로써, 벤치마크 전반에서 작업 덧셈 시 최대 5.8점 높은 정확도와 작업 부정 시 최대 13.1점 낮은 오차를 달성한다. 이는 NTK 자체가 아니라 가중치 분리도가 사전 훈련된 모델에서 효과적인 작업 산술을 가능하게 하는 핵심 요소임을 시사한다.

ABSTRACT

Task arithmetic has recently emerged as a cost-effective and scalable approach to edit pre-trained models directly in weight space: By adding the fine-tuned weights of different tasks, the model's performance can be improved on these tasks, while negating them leads to task forgetting. Yet, our understanding of the effectiveness of task arithmetic and its underlying principles remains limited. We present a comprehensive study of task arithmetic in vision-language models and show that weight disentanglement is the crucial factor that makes it effective. This property arises during pre-training and manifests when distinct directions in weight space govern separate, localized regions in function space associated with the tasks. Notably, we show that fine-tuning models in their tangent space by linearizing them amplifies weight disentanglement. This leads to substantial performance improvements across multiple task arithmetic benchmarks and diverse models. Building on these findings, we provide theoretical and empirical analyses of the neural tangent kernel (NTK) of these models and establish a compelling link between task arithmetic and the spatial localization of the NTK eigenfunctions. Overall, our work uncovers novel insights into the fundamental mechanisms of task arithmetic and offers a more reliable and effective approach to edit pre-trained models through the NTK linearization.

연구 동기 및 목표

  • 사전 훈련된 모델에서 작업 산술이 가능하게 하는 기본 메커니즘을 이해하는 것.
  • 비선형 모델에서 신경 탄성 커널(NTK)의 한계에도 불구하고 작업 산술이 작동하는 이유를 탐구하는 것.
  • 탄성 공간에서 선형화된 미세조정을 통해 모델 편집의 신뢰성과 성능을 향상시키는 것.
  • 가중치 분리도와 NTK 고유함수의 공간적 국소화 사이의 연결 고리를 설정하는 것.
  • 가중치 분리도가 무작위 초기화 시 존재하지 않으며, 사전 훈련 과정에서 기인한 잠재적 성질임을 입증하는 것.

제안 방법

  • 저자들은 작업 산술을 작업별 가중치 업데이트의 덧셈 조합을 가능하게 하는 성질(성질 1)로 수식화한다.
  • 모델의 동역학을 그 탄성 공간을 사용해 근사함으로써 선형화된 미세조정을 도입하여, 사전 훈련된 가중치 주변에서 모델을 선형화한다.
  • 다양한 가중치 방향이 서로 다른 입력 영역에 독립적으로 영향을 미치는 정도를 측정하는 분리도 오차 지표를 통해 가중치 분리도를 정량화한다.
  • NTK 고유함수의 공간적 국소화를 분석하여 선형화된 모델에서 커널 구조와 功能적 분리도 사이의 이론적 연결 고리를 확립한다.
  • CLIP, ConvNeXt, T5-Base 모델을 대상으로 시각 및 자연어 처리 작업에서 실험하여 아키텍처 및 모odal 간 일반화를 검증한다.
  • VQA, Hateful Memes, IMDB/QASC 등의 다양한 벤치마크에서 비선형 및 선형화된 미세조정을 비교하여 작업 덧셈 및 부정 시 성능을 평가한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 모델에서 작업 산술이 가능하게 하는 근본적인 성질은 무엇이며, 왜 무작위 초기화 모델에서는 실패하는가?
  • RQ2신경 탄성 커널(NTK)이 비선형 사전 훈련된 모델에서 작업 산술을 얼마나 잘 설명할 수 있는가?
  • RQ3모델을 탄성 공간에서 선형화함으로써 가중치 분리도와 작업 산술 성능에 어떤 영향을 미치는가?
  • RQ4가중치 분리도는 사전 훈련의 잠재적 성질인가, 만약 그렇다면 언제 발생하는가?
  • RQ5NTK 고유함수의 공간적 국소화와 모델 가중치의 기능적 분리도 사이의 관계는 무엇인가?

주요 결과

  • 선형화된 미세조정은 작업 산술 성능을 크게 향상시키며, 비선형 미세조정 대비 작업 덧셈 시 최대 5.8점 높은 정확도와 작업 부정 시 최대 13.1점 낮은 오차를 기록한다.
  • 서로 다른 가중치 방향이 서로 겹치지 않는 입력 영역을 제어하는 가중치 분리도가 작업 산술을 가능하게 하는 핵심 요소이며, NTK 자체가 아니라 이 분리도가 핵심이다.
  • 가중치 분리도는 사전 훈련 과정 중에 발생하며, 무작위 초기화 시에는 존재하지 않아 사전 훈련 과정에서 기인한 잠재적 성질임을 시사한다.
  • 사전 훈련된 모델에서 NTK 고유함수의 공간적 국소화는 기능적 분리도와 상관관계가 있으며, 이는 선형화된 미세조정의 성공에 대한 이론적 근거를 제공한다.
  • 이 방법은 아키텍처 및 모달 간에 일반화되며, CLIP, ConvNeXt(시각) 및 T5-Base(자연어 처리) 모델 모두에서 성공적인 작업 산술을 보여준다.
  • 무작위 초기화 모델이 작업 산술에 실패하는 것은 학습 능력이 열악하기 때문이 아니라, 가중치 분리도가 부족하기 때문이다. 이는 중간 수준의 단일 작업 정확도를 달성하더라도 여전히 실패한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.