[논문 리뷰] TransTailor: Pruning the Pre-trained Model for Improved Transfer Learning
TransTailor는 사전 훈련된 모델을 대상 작업에 민감한 가중치 중요도 기반으로 프루닝하여, 단순히 피니팅 가중치에 의존하는 것과는 달리 성능을 향상시키는 새로운 전이 학습 방법을 제안한다. 작업별 중요도 점수를 사용해 반복적으로 프루닝 및 피니팅을 수행함으로써, 더 작은 최적화된 하위 모델을 생성하며, FLOPs를 감소시켜 여러 데이터셋에서 최신 기술을 초월하는 정확도를 달성한다.
The increasing of pre-trained models has significantly facilitated the performance on limited data tasks with transfer learning. However, progress on transfer learning mainly focuses on optimizing the weights of pre-trained models, which ignores the structure mismatch between the model and the target task. This paper aims to improve the transfer performance from another angle - in addition to tuning the weights, we tune the structure of pre-trained models, in order to better match the target task. To this end, we propose TransTailor, targeting at pruning the pre-trained model for improved transfer learning. Different from traditional pruning pipelines, we prune and fine-tune the pre-trained model according to the target-aware weight importance, generating an optimal sub-model tailored for a specific target task. In this way, we transfer a more suitable sub-structure that can be applied during fine-tuning to benefit the final performance. Extensive experiments on multiple pre-trained models and datasets demonstrate that TransTailor outperforms the traditional pruning methods and achieves competitive or even better performance than other state-of-the-art transfer learning methods while using a smaller model. Notably, on the Stanford Dogs dataset, TransTailor can achieve 2.7% accuracy improvement over other transfer methods with 20% fewer FLOPs.
연구 동기 및 목표
- 기존 방법이 가중치 조정만 고려하는 바에 비해, 사전 훈련된 모델과 대상 작업 간의 구조적 불일치 문제를 해결하기 위해.
- 모델 아키텍처를 고정된 것으로 간주하는 대신, 모델 구조와 가중치를 모두 최적화하여 전이 성능을 향상시키기 위해.
- 원본 작업이 아닌 특정 대상 작업에 맞게 사전 훈련된 모델의 아키텍처를 조정하는 프루닝 전략을 개발하기 위해.
- 대상 작업에 민감한 필터 중요도에 의해 이끌리는 반복적 프루닝 및 피니팅을 통해 최적의 작업별 하위 모델을 생성하기 위해.
- 표준 피니팅보다도 더 작은 모델로도 성능을 높일 수 있음을 입증하기 위해, 프루닝을 통한 모델 구조 조정이 표준 피니팅보다 우수한 성능을 낼 수 있음을 보여주기 위해.
제안 방법
- 히우리스틱이나 원본 작업 메트릭에 의존하지 않고, 대상 작업에 민감한 필터 중요도를 추정하기 위한 학습 기반 방법을 제안한다.
- 원본 작업 중요도 점수를 대상 작업에 민감한 중요도로 변환하는 변환 과정을 도입하여 프루닝 결정보를 내리기 위한 기반을 마련한다.
- 각 단계에서 업데이트된 중요도 점수를 사용해 다음 라운드의 프루닝 및 최적화를 이끄는 반복적 프루닝 및 피니팅을 적용한다.
- 계산된 대상 작업에 민감한 중요도를 프루닝 과정과 이후 피니팅에 모두 활용하여, 프루닝된 모델이 대상 작업에 대해 효과적으로 유지되도록 보장한다.
- 압축 비율이 아닌 작업별 성능을 중심으로 하여 정확도와 모델 크기의 균형을 맞추는 최적의 하위 모델을 식별하는 검색 전략을 적용한다.
- 일반화 능력을 검증하기 위해 다양한 아키텍처(ResNet-101, VGG-16, EfficientNet-B0)와 데이터셋에 걸쳐 이 방법을 적용한다.
실험 결과
연구 질문
- RQ1대상 작업에 민감한 중요도 기반으로 사전 훈련된 모델을 프루닝하는 것이 표준 피니팅보다 더 나은 전이 학습 성능을 낼 수 있는가?
- RQ2프루닝을 통한 아키텍처 조정이 전이 학습에서 원본 작업과 대상 작업 간의 구조적 불일치 문제를 완화하는가?
- RQ3다양한 모델 아키텍처에서 프루닝된 작업 최적화 하위 모델의 성능은 표준 피니팅 및 다른 프루닝 베이스라인과 비교해 어떻게 되는가?
- RQ4다양한 대상 작업에 대해 최적의 하위 모델을 생성할 때, 레이어 간 필터 프루닝 분포에서 나타나는 패턴은 무엇인가?
- RQ5제안된 방법은 최신 기술 대비 더 적은 FLOPs로 더 높은 정확도를 달성할 수 있는가?
주요 결과
- Stanford Dogs 데이터셋에서 TransTailor는 다른 전이 학습 방법보다 2.7% 정확도를 높였고, FLOPs를 20% 감소시켰다.
- 50%의 FLOPs 감소 조건에서 TransTailor는 베이스라인보다 8.1% 높은 성능을 보였으며, 이는 고압축 환경에서의 우수성을 입증한다.
- VGG-16에서 TransTailor는 표준 피니팅 및 전체 피니팅 모두를 능가하면서 FLOPs를 20%에서 50%까지 감소시켰다.
- EfficientNet-B0에서 TransTailor는 표준 피니팅보다 7.0% 높은 정확도를 달성했고, 전체 피니팅보다 0.7% 높으며, FLOPs는 20% 줄였다.
- 프루닝된 필터는 균일하게 분포하지 않는다: 얕은 레이어는 일반적인 특징 표현 기능을 위해 더 많은 필터를 유지하는 반면, 깊은 레이어는 더 많은 프루닝이 이루어지며 특히 마지막 합성곱 레이어에서 두드러진다.
- ResNet-101에서 필터 프루닝 분포는 VGG-16에서 관찰된 규칙성과는 거리가 있다. 이는 잔차 블록의 앙상블 특성으로 인해 얕은 레이어의 공통 저수준 특징 가정이 약화되기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.