[논문 리뷰] Reusing Pretrained Models by Multi-linear Operators for Efficient Training
이 논문은 작은 사전학습 모델에서 더 큰 타겟 모델로 전체 가중치 매핑을 가능하게 하는 다중선형 연산자 Mango를 제안한다. 이는 전체 네트워크에 걸쳐 상호 및 내부 가중치 상관관계를 포착한다. 큰 매핑 텐서를 텐서 링 구조로 분해함으로써 Mango는 계산 및 메모리 비용을 줄이며 DeiT-base 전이 시 76% 낮은 FLOPs를 달성하고, 훈련 효율성에서 bert2BERT와 LiGO를 각각 12.0% 및 20.7% 뛰어넘는다.
Training large models from scratch usually costs a substantial amount of resources. Towards this problem, recent studies such as bert2BERT and LiGO have reused small pretrained models to initialize a large model (termed the ``target model''), leading to a considerable acceleration in training. Despite the successes of these previous studies, they grew pretrained models by mapping partial weights only, ignoring potential correlations across the entire model. As we show in this paper, there are inter- and intra-interactions among the weights of both the pretrained and the target models. As a result, the partial mapping may not capture the complete information and lead to inadequate growth. In this paper, we propose a method that linearly correlates each weight of the target model to all the weights of the pretrained model to further enhance acceleration ability. We utilize multi-linear operators to reduce computational and spacial complexity, enabling acceptable resource requirements. Experiments demonstrate that our method can save 76\% computational costs on DeiT-base transferred from DeiT-small, which outperforms bert2BERT by +12.0\% and LiGO by +20.7\%, respectively.
연구 동기 및 목표
- 기존 모델 정련 및 성장 방법에서 부분적 가중치 매핑의 비효율성을 해결하기 위해.
- 전체 모델에 걸친 상호 및 내부 가중치 상관관계를 활용하여 초기화 품질을 향상시키기 위해.
- 작은 모델과 큰 모델 간 전체 매핑의 계산 및 메모리 비용을 줄이기 위해.
- 사전학습된 작은 모델을 사용하여 대규모 트랜스포머의 더 빠르고 효율적인 훈련을 가능하게 하기 위해.
- 자원 소비와 탄소 배출을 최소화하여 그린 AI를 지원하기 위해.
제안 방법
- 사전학습된 모델의 모든 가중치와 타겟 모델의 각 가중치 간 상관관계를 고려한 전체 매핑 전략을 제안하며, 부분적 또는 레이어별 매핑이 아닌 방식을 사용한다.
- 큰 전체 매핑 텐서를 공간과 계산량을 줄여 효율적으로 표현하기 위해 텐서 링 분해 기반의 다중선형 연산자인 Mango를 도입한다.
- 랭크로 연결된 네 개의 저랭크 텐서를 사용해 전체 매핑을 근사함으로써 확장 가능하고 학습 가능한 파rameterization을 가능하게 한다.
- 타겟 모델과 함께 엔드 투 엔드로 Mango 연산자를 훈련시어, 작은 모델에서 큰 모델로의 최적 변환을 학습할 수 있도록 한다.
- 비전(DeiT), 자연어 처리(NLP, BERT), 언어 모델(GPT)에 적용하여 아키텍처 간 일반화 능력을 입증한다.
- 평가를 위해 표준 훈련 프로토콜을 사용하며, AdamW 옵timizer, 학습률 1e-4, 가중치 감쇠 1e-2, 배치 크기 512를 사용한다.
실험 결과
연구 질문
- RQ1모든 모델 파rameter에 걸쳐 전체 가중치 매핑이 부분적 가중치 매핑에 비해 훈련 효율성을 향상시킬 수 있는가?
- RQ2Mango와 같은 다중선형 연산자가 성능 손실 없이 전체 매핑 텐서를 효과적으로 압축할 수 있는가?
- RQ3모델 간 상호 및 내부 가중치 상관관계를 활용하면 수렴 속도 향상과 더 나은 정확도를 달성할 수 있는가?
- RQ4FLOPs와 훈련 속도 측면에서 bert2BERT 및 LiGO와 같은 최신 기법들과 비교해 본다면 제안된 방법은 어떠한가?
- RQ5Mango는 ViT, BERT, GPT와 같은 다양한 아키텍처로 일반화 가능한가?
주요 결과
- DeiT-small에서 DeiT-base로 전이할 때 Mango는 FLOPs를 76% 감소시키며 기준 방법들보다 뚜렷이 뛰어난 성능을 보였다.
- GLUE 벤치마크에서 Mango는 평균 정확도 90.60%를 달성하여 bert2BERT(+12.0%)와 LiGO(+20.7%)의 훈련 효율성에서 앞서는 성과를 보였다.
- SQuADv1.1에서 Mango는 F1 점수 90.17%를 기록하여 bert2BERT(90.02%)와 LiGO(90.09%)를 뛰어넘었으며, FLOPs도 더 낮게 유지했다.
- GPT-Small에서 GPT-Base로 전이할 때 Mango는 훈련 가속도 비율 59.9%를 달성하여 bert2BERT와 LiGO를 초월하는 수렴 속도를 보였다.
- Mango는 전체 과정 동안 가장 낮은 훈련 손실을 유지했으며, GPT에서 bert2BERT와 LiGO에 비해 각각 +16.7% 및 +21.8% 높은 성능을 달성했다.
- 비전, NLP, 언어 모델링 작업 전반에서 일관된 성과를 보이며, 이는 일반화 및 확장 가능성의 증거가 되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.