[논문 리뷰] MatFormer: Nested Transformer for Elastic Inference
MatFormer는 각 피드포워드 네트워크 블록 내에서 크기가 다른 여러 하위망을 함께 훈련함으로써 유연한 추론을 가능하게 하는 중첩된 트랜스포머 아키텍처를 도입한다. 이는 추가 훈련 없이도 수백 개의 정확하고 행동적으로 일관된 하위모델을 자유롭게 추출할 수 있게 하며, 언어 및 비전 작업 전반에서 독립적으로 훈련된 모델들과 비교할 만한 성능을 달성한다. 특히 사전 추측 추론과 검색 분야에서 최신 기술 수준의 성능을 기록한다.
Foundation models are applied in a broad spectrum of settings with different inference constraints, from massive multi-accelerator clusters to resource-constrained standalone mobile devices. However, the substantial costs associated with training these models often limit the number of unique model sizes that can be offered. Consequently, practitioners are compelled to select a model that may not be optimally aligned with their specific latency and cost requirements. We present MatFormer, a novel Transformer architecture designed to provide elastic inference across diverse deployment constraints. MatFormer achieves this by incorporating a nested Feed Forward Network (FFN) block structure within a standard Transformer model. During training, we optimize the parameters of multiple nested FFN blocks with varying sizes, enabling the extraction of hundreds of accurate smaller models without incurring additional computational costs. We empirically validate the efficacy of MatFormer across different model classes (decoders and encoders) and modalities (language and vision), demonstrating its potential for real-world deployment. We show that a 850M decoder-only MatFormer language model (MatLM) allows us to extract multiple smaller models spanning from 582M to 850M parameters, each exhibiting better validation loss and one-shot downstream evaluations than independently trained counterparts. Furthermore, we observe that smaller encoders extracted from a universal MatFormer-based ViT (MatViT) encoder preserve the metric-space structure for adaptive large-scale retrieval. Finally, we showcase that speculative decoding with the accurate and consistent submodels extracted from MatFormer can lead to significant reduction in inference latency. Project website: https://devvrit.github.io/matformer/
연구 동기 및 목표
- 모바일 디바이스와 대규모 클러스터와 같은 다양한 추론 환경에서 기초 모델을 배포할 때 발생하는 높은 훈련 비용과 제한된 모델 세분화 수준 문제를 해결하기 위해.
- 크기가 다른 독립적으로 훈련된 모델들 간의 행동 일관성 부족과 추론 최적화 호환성 문제를 극복하기 위해.
- 단일로 훈련된 유니버설 모델에서 수백 개의 정확한 하위모델을 추출함으로써 지연 시간, 비용, 정확도 간의 트레이드오프를 세밀하게 제어할 수 있도록 하기 위해.
- 재훈련 없이도 다양한 모델 크기, 모odalities(언어 및 비전), 작업에서 높은 성능를 유지하기 위해.
- 하위모델 간의 거리 공간 구조와 일관성을 유지함으로써 사전 추측 추론과 적응형 검색을 지원하기 위해.
제안 방법
- 피드포워드 네트워크(FFN) 블록 내에 더 작은 하위모델을 더 큰 모델 내에 통합하는 중첩 구조를 도입하여, T₁ ⊂ T₂ ⊂ … ⊂ T₉와 같은 계층적 구조를 형성한다.
- 모든 중첩된 하위모델을 한 번의 훈련 런 동안 개별 손실를 조합하여 공동으로 훈련함으로써 파라미터 공유와 일관성을 보장한다.
- 신경망의 뉴런과 어텐션 헤드를 가장 중요도가 높은 것에서 낮은 것 순서로 정렬함으로써 마트료시카 표현 학습 원리를 적용하여 계층적 추출을 가능하게 한다.
- 모든 레이어의 하위블록을 임의 조합하여 gˡ 개의 서로 다른 모델을 생성할 수 있는 Mix'n'Match 추출 기능을 제공하며, 이는 모델의 세분화 수준을 기하급수적으로 증가시킨다.
- 비교적 높은 비율의 비임bedding 파라미터와 지연 시간을 차지하는 FFN 블록에 집중함으로써 추론 효율성 향상을 극대화한다.
- 비전 인코더(MatViT)에서 거리 공간 구조를 유지함으로써 적응형 대규모 검색 시스템에서 효과적으로 활용할 수 있도록 한다.
실험 결과
연구 질문
- RQ1단일 유니버설 트랜스포머 모델을 훈련시켜 추가 훈련 없이도 다양한 크기의 정확하고 행동적으로 일관된 하위모델 수백 개를 추출할 수 있는가?
- RQ2MatFormer에서 추출된 하위모델은 자연어 처리 및 비전 작업에서 독립적으로 훈련된 모델들과 비교해 얼마나 잘 성능을 내는가?
- RQ3중첩 아키텍처는 검색 응용 분야에서 비전 인코더의 거리 공간 구조를 어느 정도 유지하는가?
- RQ4추출된 하위모델을 활용한 사전 추측 추론은 정확도를 유지하면서 추론 지연 시간을 줄일 수 있는가?
- RQ5중첩된 하위모델을 공동으로 훈련시키는 방식이 다양한 세분화 수준 간의 일반화 능력에 어떤 영향을 미치는가?
주요 결과
- 2.6B 파라미터를 가진 MatLM 디코더 모델은 1.5B에서 2.6B 파라미터까지의 하위모델을 추출할 수 있으며, 각 하위모델이 독립적으로 훈련된 모델들과 비교해 검증 손실 및 원샷 다운스트림 성능에서 유사한 성능을 기록한다.
- MatViT에서 추출된 하위모델는 거리 공간 구조를 유지하여 효과적인 대규모 적응형 검색을 가능하게 한다.
- MatFormer에서 추출된 정확하고 일관된 하위모델을 활용한 사전 추측 추론은 정확도를 훼손하지 않으면서 추론 지연 시간을 줄였다.
- TriviaQA 벤치마크에서 1.55B 파라미터의 MatFormer 하위모델은 26.15%의 EM 점수를 기록하여 1.65B의 독립적으로 훈련된 모델과 동일한 성능을 달성했다.
- 14개의 다운스트림 작업에서 추출된 1.55B 하위모델의 평균 EM 점수는 48.39%에 달했으며, 전체 2.6B 모델의 49.18%에 매우 가까운 성능을 기록했다.
- 추출된 1.55B 하위모델의 개발 세트 로그 퍼플렉서티는 2.663이었고, 전체 2.6B 모델의 2.65와 매우 유사하여 강력한 일반화 능력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.