Skip to main content
QUICK REVIEW

[논문 리뷰] TransTailor: Pruning the Pre-trained Model for Improved Transfer Learning

Bingyan Liu, Yifeng Cai|arXiv (Cornell University)|2021. 03. 02.
Domain Adaptation and Few-Shot Learning참고 문헌 28인용 수 6
한 줄 요약

TransTailor는 사전 훈련된 모델을 대상 작업에 민감한 가중치 중요도 기반으로 프루닝하여, 단순히 피니팅 가중치에 의존하는 것과는 달리 성능을 향상시키는 새로운 전이 학습 방법을 제안한다. 작업별 중요도 점수를 사용해 반복적으로 프루닝 및 피니팅을 수행함으로써, 더 작은 최적화된 하위 모델을 생성하며, FLOPs를 감소시켜 여러 데이터셋에서 최신 기술을 초월하는 정확도를 달성한다.

ABSTRACT

The increasing of pre-trained models has significantly facilitated the performance on limited data tasks with transfer learning. However, progress on transfer learning mainly focuses on optimizing the weights of pre-trained models, which ignores the structure mismatch between the model and the target task. This paper aims to improve the transfer performance from another angle - in addition to tuning the weights, we tune the structure of pre-trained models, in order to better match the target task. To this end, we propose TransTailor, targeting at pruning the pre-trained model for improved transfer learning. Different from traditional pruning pipelines, we prune and fine-tune the pre-trained model according to the target-aware weight importance, generating an optimal sub-model tailored for a specific target task. In this way, we transfer a more suitable sub-structure that can be applied during fine-tuning to benefit the final performance. Extensive experiments on multiple pre-trained models and datasets demonstrate that TransTailor outperforms the traditional pruning methods and achieves competitive or even better performance than other state-of-the-art transfer learning methods while using a smaller model. Notably, on the Stanford Dogs dataset, TransTailor can achieve 2.7% accuracy improvement over other transfer methods with 20% fewer FLOPs.

연구 동기 및 목표

  • 기존 방법이 가중치 조정만 고려하는 바에 비해, 사전 훈련된 모델과 대상 작업 간의 구조적 불일치 문제를 해결하기 위해.
  • 모델 아키텍처를 고정된 것으로 간주하는 대신, 모델 구조와 가중치를 모두 최적화하여 전이 성능을 향상시키기 위해.
  • 원본 작업이 아닌 특정 대상 작업에 맞게 사전 훈련된 모델의 아키텍처를 조정하는 프루닝 전략을 개발하기 위해.
  • 대상 작업에 민감한 필터 중요도에 의해 이끌리는 반복적 프루닝 및 피니팅을 통해 최적의 작업별 하위 모델을 생성하기 위해.
  • 표준 피니팅보다도 더 작은 모델로도 성능을 높일 수 있음을 입증하기 위해, 프루닝을 통한 모델 구조 조정이 표준 피니팅보다 우수한 성능을 낼 수 있음을 보여주기 위해.

제안 방법

  • 히우리스틱이나 원본 작업 메트릭에 의존하지 않고, 대상 작업에 민감한 필터 중요도를 추정하기 위한 학습 기반 방법을 제안한다.
  • 원본 작업 중요도 점수를 대상 작업에 민감한 중요도로 변환하는 변환 과정을 도입하여 프루닝 결정보를 내리기 위한 기반을 마련한다.
  • 각 단계에서 업데이트된 중요도 점수를 사용해 다음 라운드의 프루닝 및 최적화를 이끄는 반복적 프루닝 및 피니팅을 적용한다.
  • 계산된 대상 작업에 민감한 중요도를 프루닝 과정과 이후 피니팅에 모두 활용하여, 프루닝된 모델이 대상 작업에 대해 효과적으로 유지되도록 보장한다.
  • 압축 비율이 아닌 작업별 성능을 중심으로 하여 정확도와 모델 크기의 균형을 맞추는 최적의 하위 모델을 식별하는 검색 전략을 적용한다.
  • 일반화 능력을 검증하기 위해 다양한 아키텍처(ResNet-101, VGG-16, EfficientNet-B0)와 데이터셋에 걸쳐 이 방법을 적용한다.

실험 결과

연구 질문

  • RQ1대상 작업에 민감한 중요도 기반으로 사전 훈련된 모델을 프루닝하는 것이 표준 피니팅보다 더 나은 전이 학습 성능을 낼 수 있는가?
  • RQ2프루닝을 통한 아키텍처 조정이 전이 학습에서 원본 작업과 대상 작업 간의 구조적 불일치 문제를 완화하는가?
  • RQ3다양한 모델 아키텍처에서 프루닝된 작업 최적화 하위 모델의 성능은 표준 피니팅 및 다른 프루닝 베이스라인과 비교해 어떻게 되는가?
  • RQ4다양한 대상 작업에 대해 최적의 하위 모델을 생성할 때, 레이어 간 필터 프루닝 분포에서 나타나는 패턴은 무엇인가?
  • RQ5제안된 방법은 최신 기술 대비 더 적은 FLOPs로 더 높은 정확도를 달성할 수 있는가?

주요 결과

  • Stanford Dogs 데이터셋에서 TransTailor는 다른 전이 학습 방법보다 2.7% 정확도를 높였고, FLOPs를 20% 감소시켰다.
  • 50%의 FLOPs 감소 조건에서 TransTailor는 베이스라인보다 8.1% 높은 성능을 보였으며, 이는 고압축 환경에서의 우수성을 입증한다.
  • VGG-16에서 TransTailor는 표준 피니팅 및 전체 피니팅 모두를 능가하면서 FLOPs를 20%에서 50%까지 감소시켰다.
  • EfficientNet-B0에서 TransTailor는 표준 피니팅보다 7.0% 높은 정확도를 달성했고, 전체 피니팅보다 0.7% 높으며, FLOPs는 20% 줄였다.
  • 프루닝된 필터는 균일하게 분포하지 않는다: 얕은 레이어는 일반적인 특징 표현 기능을 위해 더 많은 필터를 유지하는 반면, 깊은 레이어는 더 많은 프루닝이 이루어지며 특히 마지막 합성곱 레이어에서 두드러진다.
  • ResNet-101에서 필터 프루닝 분포는 VGG-16에서 관찰된 규칙성과는 거리가 있다. 이는 잔차 블록의 앙상블 특성으로 인해 얕은 레이어의 공통 저수준 특징 가정이 약화되기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.