Skip to main content
QUICK REVIEW

[논문 리뷰] Model Spider: Learning to Rank Pre-Trained Models Efficiently

Yi-Kai Zhang, Ting-Ji Huang|arXiv (Cornell University)|2023. 06. 06.
Machine Learning and Data Classification인용 수 5
한 줄 요약

Model Spider는 사전 훈련된 모델(PTM)과 유하업 태스크를 모두 의미 벡터로 인코딩하여, 전체 미세조정 없이도 빠른 이식 가능성 추정이 가능한 토큰 기반의 효율적 방법을 제안한다. 이는 다양한 벤치마크에서 높은 순위 정확도 유지를 바탕으로 기존 방법 대비 최대 1000배 빠른 성능을 기록하며 사전 훈련된 모델 선택 분야에서 최고 성능을 달성한다.

ABSTRACT

Figuring out which Pre-Trained Model (PTM) from a model zoo fits the target task is essential to take advantage of plentiful model resources. With the availability of numerous heterogeneous PTMs from diverse fields, efficiently selecting the most suitable PTM is challenging due to the time-consuming costs of carrying out forward or backward passes over all PTMs. In this paper, we propose Model Spider, which tokenizes both PTMs and tasks by summarizing their characteristics into vectors to enable efficient PTM selection. By leveraging the approximated performance of PTMs on a separate set of training tasks, Model Spider learns to construct tokens and measure the fitness score between a model-task pair via their tokens. The ability to rank relevant PTMs higher than others generalizes to new tasks. With the top-ranked PTM candidates, we further learn to enrich task tokens with their PTM-specific semantics to re-rank the PTMs for better selection. Model Spider balances efficiency and selection ability, making PTM selection like a spider preying on a web. Model Spider demonstrates promising performance in various configurations of model zoos.

연구 동기 및 목표

  • 큰 이질적인 모델 저널에서 가장 이식 가능한 사전 훈련된 모델(PTM)을 효율적으로 선별하는 문제를 해결하기 위해.
  • 모든 모델에 대해 전체 미세조정을 수행함으로써 발생하는 계산 비용을 줄이기 위해.
  • 미리 정의되지 않은 유하업 태스크로도 일반화 가능한 일반 목적의 토큰화 및 순위 매기기 메커니즘을 학습하기 위해.
  • 계산 예산이 허락할 경우 PTM별 특징을 통합함으로써 효율성과 정확성 사이의 민감한 트레이드오프를 가능하게 하기 위해.
  • 상위 PTM들로부터 얻은 태스크별 특징을 활용해 초기 순위를 보완함으로써 선택 성능를 향상시키기 위해.

제안 방법

  • 일반 인코더를 사용하여 PTM과 태스크를 모두 학습 가능한 벡터 토큰으로 인코딩함으로써, 그들의 의미적 및 기능적 특성을 포착한다.
  • Transformer 기반 모듈을 활용해 태스크 토큰과 PTM 토큰 간의 유사도 점수를 계산함으로써, 전방향 프로파게이션 없이도 이식 가능성 추정을 수행한다.
  • 이전의 태스크-PTM 성능 데이터 기반 순위 집합을 활용해 지도 학습 방식으로 훈련함으로써, 상위 순위의 PTM 토큰이 해당 태스크 토큰과 일치하도록 정렬한다.
  • 정확도 향상을 위해, 후보 모델의 일부에 대해 전방향 프로파게이션을 수행하여 PTM별 특징을 추출하고 상위 PTM들을 재순위 매긴다.
  • 프레임워크는 탄력적인 예산 트레이드오프를 지원한다: 최대 속도를 위해 일반 토큰만 사용하거나, 더 높은 정확도를 위해 PTM별 특징을 추가할 수 있다.
  • 전체 파ip라인은 엔드 투 엔드 미분 가능하여 토큰화 및 순위 매기기 구성 요소를 함께 최적화할 수 있다.

실험 결과

연구 질문

  • RQ1전체 미세조정 없이도 새로운 유하업 태스크에 대해 사전 훈련된 모델의 이식 가능성 정확도를 예측할 수 있는가?
  • RQ2최소한의 계산 오버헤드로 대규모 이질적인 사전 훈련된 모델 저널을 효율적으로 순위 매길 수 있는가?
  • RQ3학습된 토큰화 체계가 새로운 태스크로 일반화되어 다양한 도메인에서 높은 순위 정확도를 유지할 수 있는가?
  • RQ4PTM별 특징은 선택 정확도를 어느 정도 향상시키며, 이는 추론 효율성과의 트레이드오프로 이어지는가?
  • RQ5제안된 방법은 기존 전방향 프로파게이션 기반 이식 가능성 추정 방법보다 속도와 순위 성능 양면에서 뛰어나게 성능을 발휘하는가?

주요 결과

  • Model Spider는 ImageNet-1K에서 가중 킬라드의 타우 상관계수 0.977을 기록하며, 모든 베이스라인 대비 뛰어난 순위 정확도를 확보했다.
  • PTM 순위 매기기 평균 월클록 시간을 전체 미세조정 기반의 600,000초 이상에서, PTM별 특징 없이도 52.36초로 단축시켜 약 10,000배의 속도 향상을 달성했다.
  • 42개의 PTM별 특징을 사용할 경우, Model Spider의 추론 시간은 2,402.77초로 증가하지만 여전히 전체 미세조정 대비 250배 빠른 성능이다.
  • CIFAR-10, CUB-200, ImageNet-1K 포함 총 18개 데이터셋에서 높은 성능을 유지하며 강력한 일반화 능력을 입증했다.
  • 제거 실험 결과, 일반 토큰화와 PTM별 특징 강화 모두 순위 성능 향상에 기여한다는 게 확인되었다.
  • Model Spider의 메모리 프로파일은 특징 없이도 608MB에 불과하여 자원 제약 환경에서의 구현에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.