Skip to main content
QUICK REVIEW

[논문 리뷰] Sparse Structure Search for Parameter-Efficient Tuning

Shengding Hu, Zhen Zhang|arXiv (Cornell University)|2022. 06. 15.
Modular Robots and Swarm Intelligence인용 수 6
한 줄 요약

S3 PET는 사전 훈련된 모델 내에서 희소하고 파rameter 효율적인 튜닝(PET) 구조를 자동으로 탐색하기 위해 미분 가능하고 이중 최적화 프레임워크를 제안한다. 이는 이동된 전역 시그모이드를 사용해 훈련 가능한 파ram터 수를 명시적으로 제어한다. 전체 미세조정 성능의 99% 이상을 달성하면서도 훈련 가능한 파ram터 비율이 0.01%에 불과하며, 수작업으로 설계된 구조들을 능가하면서도 다양한 작업 간 이식성이 뛰어나다.

ABSTRACT

Adapting large pre-trained models (PTMs) through fine-tuning imposes prohibitive computational and storage burdens. Recent studies of parameter-efficient tuning (PET) find that only optimizing a small portion of parameters conditioned on PTMs could yield on-par performance compared to conventional fine-tuning. Generally, PET methods exquisitely design parameter-efficient modules (PET modules) which could be applied to arbitrary fine-grained positions inside PTMs. However, the effectiveness of these fine-grained positions largely relies on sophisticated manual designation, thereby usually producing sub-optimal results. In contrast to the manual designation, we explore constructing PET modules in an automatic manner. We automatically extbf{S}earch for the extbf{S}parse extbf{S}tructure of extbf{P}arameter- extbf{E}fficient extbf{T}uning (S$^3$PET). Based on a unified framework of various PET methods, S$^3$PET conducts the differentiable PET structure search through bi-level optimization and proposes shifted global sigmoid method to explicitly control the number of trainable parameters. Extensive experiments show that S$^3$PET surpasses manual and random structures with less trainable parameters. The searched structures preserve more than 99\% fine-tuning performance with 0.01\% trainable parameters. Moreover, the advantage of S$^3$PET is amplified with extremely low trainable parameters budgets (0.0009\%$\sim$0.01\%). The searched structures are transferable and explainable, providing suggestions and guidance for the future design of PET methods.

연구 동기 및 목표

  • 파ram터 효율적인 미세조정에서 수작업으로 설계된 PET 모듈의 비효율성과 최적화 부족 문제를 해결하기 위해.
  • 엄격한 파라미터 예산 하에서 성능을 극대화하는 최적의 희소 PET 모듈 구조를 자동으로 탐색하기 위해.
  • 구조 탐색 과정에서 훈련 가능한 파라미터 수를 명시적으로 제어할 수 있는 방법을 개발하기 위해.
  • 다양한 최종 작업에 일반화 가능한 이식성 있고 해석 가능한 PET 구조를 만들기 위해.

제안 방법

  • 사전 훈련된 모델의 모든 레이어와 위치에 걸쳐 가능한 모든 PET 모듈에 대해 구조적 파라미터를 사용한 확률적 게이팅을 적용하여 통합된 탐색 공간을 구성한다.
  • 구조적 파라미터(아키텍처)와 모델 가중치를 동시에 최적화하기 위해 이중 최적화를 활용하여, 미분 가능한 구조 탐색을 가능하게 한다.
  • 희소성과 타깃 훈련 가능한 PET 모듈 수를 명시적으로 제어하기 위해 이동된 전역 시그모이드 함수를 도입한다.
  • PET 구조 탐색을 제약 조건이 있는 신경망 아키텍처 탐색 문제로 간주하고, 성능 피드백을 활용해 구조 선택을 유도한다.
  • 단일 유연한 탐색 공간 내에서 어댑터, LoRA, BitFit 등 다양한 PET 모듈을 통합하여 종단 간 최적화를 지원한다.
  • 학습을 다시 시작하지 않고도 효율적인 구조 탐색에 집중할 수 있도록 사전 훈련된 백본 모델을 기반으로 한다.

실험 결과

연구 질문

  • RQ1엄격한 파라미터 예산 하에서 자동으로 미분 가능한 방법이 수작업 설계된 것보다 더 효과적인 PET 모듈 구조를 탐색할 수 있는가?
  • RQ2어떻게 하면 특정 파라미터 효율성 요구사항을 충족시키기 위해 탐색 과정에서 희소성을 명시적으로 제어할 수 있는가?
  • RQ3탐색된 PET 구조는 다양한 최종 NLP 작업 간 얼마나 일반화되는가?
  • RQ4최적의 PET 모듈 배치에서 나타나는 패턴은 무엇이며, 이는 데이터셋 간 일관되고 해석 가능한가?
  • RQ5훈련 가능한 파라미터 수가 매우 적을 경우(예: 0.0009%~0.01%), 탐색된 구조의 성능은 기준선 대비 어떻게 되는가?

주요 결과

  • S3 PET는 GLUE에서 훈련 가능한 파라미터 비율이 0.01%에 불과함에도 불구하고 전체 미세조정 성능의 99%를 달성하며, 수작업 설계된 구조들을 크게 능가한다.
  • SuperGLUE에서 S3 PET는 동일한 0.01% 파라미터 예산 하에서 전체 미세조정 성능의 98%를 복구한다.
  • 성능을 유지하거나 향상시키면서도 훈련 가능한 파라미터 수를 약 1/5로 줄여 수작업 설계된 구조들을 능가한다.
  • 탐색된 구조는 매우 높은 이식성을 보인다: 소스 데이터셋에서 탐색한 후 타겟 작업에서 훈련할 경우, 직접 타겟에서 탐색한 구조보다 종종 뛰어난 성능을 보인다.
  • 이동된 전역 시그모이드 방법은 초저조직 파라미터 예산에서 $L_0$ 정규화보다 희소성 제어와 성능 면에서 뛰어나다.
  • 시각화 결과는 고층의 자기 및 교차 attention 모듈에 BitFit 모듈이 매우 선호되며, 인코더와 디코더의 마지막 레이어가 일관되게 강조됨을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.