[논문 리뷰] ZipIt! Merging Models from Different Tasks without Training
ZipIt!은 추가 학습 없이도 서로 다른 작업에서 사전 훈련된 딥 러닝 모델을 하나의 다중 작업 모델로 융합하는 새로운 방법을 제안한다. 예를 들어, CIFAR와 ImageNet에서 이미지 분류를 위한 모델를 통합한다. ZipIt!은 모델 내외부의 관련 특징을 '지퍼링'(zipping)할 수 있도록 일반화된 모델 융합 기법을 도입하고, 지정된 레이어까지의 부분 융합을 허용함으로써 이질적인 작업 설정에서 이전 방법보다 최대 60% 높은 정확도를 달성한다. 이는 순열 기반 융합 및 기존 기준선보다 뚜렷이 뛰어나다.
Typical deep visual recognition models are capable of performing the one task they were trained on. In this paper, we tackle the extremely difficult problem of combining distinct models with different initializations, each solving a separate task, into one multi-task model without any additional training. Prior work in model merging permutes one model to the space of the other then averages them together. While this works for models trained on the same task, we find that this fails to account for the differences in models trained on disjoint tasks. Thus, we introduce "ZipIt!", a general method for merging two arbitrary models of the same architecture that incorporates two simple strategies. First, in order to account for features that aren't shared between models, we expand the model merging problem to allow for merging features within each model by defining a general "zip" operation. Second, we add support for partially zipping the models up until a specified layer, naturally creating a multi-head model. We find that these two changes combined account for 20-60% improvement over prior work, making it more feasible to merge models trained on disjoint tasks without retraining.
연구 동기 및 목표
- 다른 작업에서 훈련된 모델을 재학습 없이 하나의 다중 작업 모델로 융합하는 문제를 해결하기 위해.
- 다른 작업 전용 특징 분포를 가진 모델에 적용했을 때 기존의 가중치 순열 기반 융합 방법이 실패하는 이유를 해결하기 위해.
- 공통된 표현을 조사하기 위해 모델 내외부에서 특징 수준의 '지퍼링'을 허용함으로써, 특징이 직접적으로 상관되지 않더라도 공유 표현을 포착할 수 있도록 하기 위해.
- 아키텍처에 종속되지 않는 일반적인 방법을 개발하여 부분 융합을 지원함으로써, 복잡하고 이질적인 작업에서의 성능을 향상시키기 위해.
제안 방법
- 1:1 가중치 순열을 넘어서, 모델 간뿐만 아니라 각 모델 내부에서도 관련 특징을 융합할 수 있도록 일반화된 '지퍼' 연산을 도입한다.
- 공통 특징을 모델 간에 식별하고 융합하기 위해 그래프 기반 알고리즘을 적용함으로써, 임의의 모델 쌍에 대한 민첩하고 확장 가능한 융합을 가능하게 한다.
- 지정된 레이어까지의 융합만 허용함으로써 부분 지퍼링을 지원하며, 융합되지 않은 헤드 브랜치를 유지함으로써 다중 헤드 아키텍처를 생성한다.
- 융합 후 특징 크기의 차이를 제한하기 위해 농도 부등식 기반 이론적 프레임워크를 사용하여 안정성과 강건성을 확보한다.
- 재학습 없이도 모델의 무결성을 유지하고 치명적인 기억 상실을 방지하기 위해 대칭적 융합 전략을 적용한다.
- 구조적으로 동일한 경우, 다양한 아키텍처를 가진 모델 간의 융합을 가능하게 하기 위해 레이어와 특징을 공통 융합 프rotocol을 통해 정렬한다.

실험 결과
연구 질문
- RQ1모델 융합 기법을 완전히 이질적인 작업(예: 강아지 품종 분류와 새 종 분류)에서 훈련된 모델을 융합하는 데 일반화할 수 있는가?
- RQ2모델이 관련 없는 작업에서 훈련된 경우, 한 모델의 가중치 공간에 다른 모델을 순열화하는 것이 실패하는가? 만약 그렇다면 그 이유는 무엇인가?
- RQ3내부 특징 확장과 모델 내부 융합이 다중 작업 설정에서 모델 간 평균화보다 성능을 향상시킬 수 있는가?
- RQ4초기 레이어에만 융합을 제한하고 나중 단계의 작업 전용 헤드를 유지하는 부분 융합이 정확도와 효율성에 얼마나 기여하는가?
- RQ5ZipIt!은 이질적인 데이터셋에서 훈련된 모델에 적용했을 때 Git Re-Basin 및 Model Soups와 같은 최신 융합 방법보다 어떻게 비교되는가?
주요 결과
- ZipIt!는 전체 융합(19/20 레이어)을 통해 CIFAR-5+5 작업에서 87.4%의 통합 정확도를 달성하여 가장 가까운 기준선(Git Re-Basin)보다 20个百分点 이상 높다.
- 19번째 레이어까지 부분 융합한 ZipIt! 19/20는 평균 89.1%의 정확도를 기록했으며, FLOPs의 절반만으로 앙상블 성능(94.1%)에 거의 도달한다.
- 20개 레이어 중 13개를 융합한 ZipIt!는 평균 90.5%의 정확도를 달성하여 부분 융합이 효율성을 유지하면서도 성능 향상에 크게 기여함을 보여준다.
- 이질적 작업 벤치마크에서 순열 기반 융합 대비 최대 60% 높은 정확도를 확보함으로써, 모델 내외부 특징 지퍼링의 필요성을 입증한다.
- REPAIR나 재학습 없이도 ZipIt!는 이러한 기법에 의존하는 방법들을 능가하며, 제로샷 융합 설정에서도 효과적임을 보여준다.
- 제거 실험을 통해 모델 내부 지퍼링과 부분 융합이 모두 성능 향상에 기여하는 핵심 요소임을 확인하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.