Skip to main content
QUICK REVIEW

[논문 리뷰] Dataless Knowledge Fusion by Merging Weights of Language Models

Xisen Jin, Xiang Ren|arXiv (Cornell University)|2022. 12. 19.
Topic Modeling인용 수 8
한 줄 요약

이 논문은 예측 차이를 매개변수 공간에서 최소화함으로써 폐쇄형 해를 사용하여 미세조정된 언어 모델을 융합하는 데이터 없는 모델 융합 방법인 Regression Mean(RegMean)을 제안한다. Fisher 가중 평균화 및 앙상블과 같은 기준 모델들보다 뛰어난 성능을 보이며, 훈련 데이터가 필요 없이 도메인 내 및 도메인 외 일반화 성능이 뛰어나다.

ABSTRACT

Fine-tuning pre-trained language models has become the prevalent paradigm for building downstream NLP models. Oftentimes fine-tuned models are readily available but their training data is not, due to data privacy or intellectual property concerns. This creates a barrier to fusing knowledge across individual models to yield a better single model. In this paper, we study the problem of merging individual models built on different training data sets to obtain a single model that performs well both across all data set domains and can generalize on out-of-domain data. We propose a dataless knowledge fusion method that merges models in their parameter space, guided by weights that minimize prediction differences between the merged model and the individual models. Over a battery of evaluation settings, we show that the proposed method significantly outperforms baselines such as Fisher-weighted averaging or model ensembling. Further, we find that our method is a promising alternative to multi-task learning that can preserve or sometimes improve over the individual models without access to the training data. Finally, model merging is more efficient than training a multi-task model, thus making it applicable to a wider set of scenarios.

연구 동기 및 목표

  • 개인정보나 지적재산권 제약으로 인해 훈련 데이터가 확보되지 않을 경우, 여러 미세조정된 언어 모델의 지식을 융합하는 문제를 해결한다.
  • 재학습이나 원본 데이터 접근 없이 매개변수 공간에서 모델을 융합하는 계산 효율적인 방법을 개발한다.
  • 다양한 데이터 세트로 훈련된 모델을 융합하여 도메인 내 성능과 도메인 외 일반화 성능을 향상시킨다.
  • 데이터 접근이 불가능한 상황에서 다중 작업 학습의 확장 가능한 대안을 제공하여 성능을 유지하거나 향상시킨다.
  • 실제 NLP 배포 환경에서 지식 융합을 위한 실용적인 솔루션으로서 모델 융합의 가능성과 이점을 입증한다.

제안 방법

  • 최적의 선형 회귀에 영감을 얻은 새로운 모델 융합 알고리즘인 Regression Mean(RegMean)을 제안하며, 융합된 모델과 개별 모델 간의 ℓ² 거리 최소화를 목표로 한다.
  • 모델 매개변수에 대한 가중 최소 제곱 최적화 문제로 융합 문제를 수식화하여 반복적 학습을 피하는 폐쇄형 해를 도출한다.
  • 개선된 융합 성능를 위해 도메인 내 및 도메인 외 예시를 소량 사용하여 피셔 정보 행렬을 추정한다.
  • 동일한 아키텍처와 사전 훈련된 가중치를 가진 여러 미세조정된 모델(예: RoBERTa, T5, DeBERTa)을 융합하기 위해 이 방법을 적용한다.
  • 모델 간 가중치를 정렬하기 위해 순열 매칭 기법을 통합하여 융합 품질을 향상시킨다.
  • 다양한 모델 유형과 데이터 분포에서 융합 효율성과 매개변수 효율성을 평가한다.

실험 결과

연구 질문

  • RQ1훈련 데이터가 확보되지 않을 경우, 매개변수 공간에서의 모델 융합이 앙상블이나 단순 평균화보다 더 높은 성능을 달성할 수 있는가?
  • RQ2제안된 RegMean 방법이 개별 미세조정된 모델에 비해 도메인 외 데이터에서 일반화 성능을 향상시키는가?
  • RQ3다양한 NLP 작업과 데이터 세트에서 RegMean의 성능가 Fisher 가중 평균화 및 기타 융합 기준 모델들과 비교해 볼 때 어떻게 되는가?
  • RQ4개인적 또는 기밀 훈련 데이터가 존재하는 상황에서 데이터 없는 융합이 다중 작업 학습의 실용적인 대안으로서 어느 정도 기능할 수 있는가?
  • RQ5도메인 내 예시를 소량(예: 10~50개) 사용하여 피셔 정보를 추정할 경우, 융합 성능에 어떤 영향을 미치며, 데이터 泄露 위험은 어떻게 되는가?

주요 결과

  • RegMean는 모든 평가 설정에서 Fisher 가중 평균화 및 모델 앙상블보다 뚜렷이 뛰어난 성능을 보이며, 도메인 내 및 도메인 외 일반화 모두에서 슈퍼리어하다.
  • 융합된 모델는 도메인 외 데이터에서 가장 우수한 개별 모델보다도 높은 성능을 달성하여 강력한 일반화 능력을 입증한다.
  • RegMean는 높은 추론 속도를 유지하며 최소한의 매개변수 오버헤드를 가지므로, 처음부터 다중 작업 모델을 학습시키는 것보다 더 효율적이다.
  • 도메인 내 예시 수가 제한되어 있어도(예: 10~50개) 피셔 정보 추정에 대해 강건하여 데이터 의존도가 낮아진다.
  • RegMean를 통한 모델 융합은 RoBERTa, T5, DeBERTa 등 다양한 아키텍처와 작업에서 성능을 유지하거나 향상시키며, 광범위한 적용 가능성을 보여준다.
  • 이 방법은 기밀 데이터로 훈련된 모델 간 지식 융합을 가능하게 하여, 데이터 제약 환경에서 다중 작업 학습의 실용적인 대안을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.