[논문 리뷰] Fine-Tuning Pre-Trained Language Models Effectively by Optimizing Subnetworks Adaptively
이 논문은 춴적 기울기 기반으로 작업 관련 하위넷을 동적으로 선택하는 새로운 적응형 미세조정 방법인 동적 파ram터 선택(DPS)을 제안한다. DPS는 다양한 모델과 자원이 제한된 환경에서도 안정성, 일반화 능력 및 성능을 향상시키며, GLUE에서 기존 방법보다 최대 1.33점 향상되며 변동성이 감소하고 계산 비용은 거의 증가하지 않는다.
Large-scale pre-trained language models have achieved impressive results on a wide range of downstream tasks recently. However, fine-tuning an extremely large-scale pre-trained language model on limited target datasets is often plagued by overfitting and representation degradation. In this paper, we propose a Dynamic Parameter Selection (DPS) algorithm for the large-scale pre-trained models during fine-tuning, which adaptively selects a more promising subnetwork to perform staging updates based on gradients of back-propagation. Experiments on the GLUE benchmark show that DPS outperforms previous fine-tuning methods in terms of overall performance and stability, and consistently achieves better results with variable pre-trained language models. In addition, DPS brings a large magnitude of improvement in out-of-domain transferring experiments and low-resource scenarios, which shows that it can maintain stable general contextual features and reduce the representation collapse. We release our code at https://github.com/ZhangHaojie077/DPS
연구 동기 및 목표
- 작은 데이터셋 또는 도메인 외부 데이터셋에서 대규모 사전 훈련된 언어 모델의 미세조정 불안정성과 낮은 일반화 능력을 해결하기 위해.
- 기존 하위넷 최적화 방법의 한계를 극복하기 위해, 예를 들어 무작위 선택(Mixout)이나 정적 하위넷( CHILD-TUNING D)은 동적 파ram터 중요도를 忽시하거나 높은 계산 비용을 유발한다.
- 기울기 누적과 최적화를 분리하지 않고도, 훈련 중에 유망한 하위넷을 적응적으로 선택할 수 있는 방법을 개발하기 위해.
- 다양한 사전 훈련된 모델 아키텍처, 하위넷 크기, 데이터 환경(저자원 및 도메인 외부 시나리오 포함)에서 모델의 안정성과 일반화 능력을 향상시키기 위해.
제안 방법
- DPS는 순환적인 이중 단계 업데이트 전략을 사용한다: 제1단계에서는 미세조정 중에 업데이트된 파ram터의 배치 내 기울기를 누적한다.
- 제2단계에서는 제1단계에서 누적된 기울기를 기반으로 단계별 중요 파ram터 하위넷을 유도하고, 이들만 업데이트하며 나머지는 고정한다.
- 두 가지 변종이 제안된다: DPS Dense는 제1단계에서 전체 네트워크를 업데이트하고 제2단계에서 동적 하위넷을 업데이트하는 방식이며, DPS Mix는 제1단계에서 출력 가중치를 사전 훈련된 가중치로 무작위 교체하고 제2단계에서는 업데이트 빈도에 대한 가중 페널티를 적용하는 방식이다.
- 파ram터의 중요도는 DPS Dense의 경우 기울기 크기 순위로 측정하고, DPS Mix의 경우 평균 기울기 값과 업데이트 빈도에 대한 지수적 페널티를 조합한 하이브리드 메트릭을 사용한다.
- 외부 기울기 계산을 피하기 위해 하위넷 유도를 훈련 루프에 통합함으로써 추가 계산 비용을 최소화한다.
- 이 방법은 GLUE 벤치마크 작업을 통해 BERT, RoBERTa, BART, ELECTRA, DeBERTa 등 다양한 사전 훈련된 모델에 적용되었다.
실험 결과
연구 질문
- RQ1미세조정 중 적응적인 하위넷 선택이 다운스트림 NLP 작업에서 모델 성능과 안정성을 향상시킬 수 있는가?
- RQ2제안된 DPS 방법이 저자원 및 도메인 외부 설정에서 과적합과 표현 퇴화를 줄일 수 있는가?
- RQ3Mixout 및 CHILD-TUNING D와 같은 기존 하위넷 최적화 방법과 비교해 DPS는 효율성과 성능 면에서 어떻게 다른가?
- RQ4DPS는 다양한 사전 훈련된 모델 아키텍처와 하위넷 크기에서 일관된 성능 향상을 유지할 수 있는가?
주요 결과
- GLUE 벤치마크에서 DPS는 기본 미세조정보다 0.44~1.33점 향상되었으며, 표준편차가 0.29~0.80점 감소하여 안정성이 향상됨을 보였다.
- 도메인 외부 전이 및 저자원 시나리오에서는 각각 최대 1.86점과 3.27점의 절대 점수 향상을 달성하여 강력한 일반화 능력을 입증했다.
- 모델 아키텍처나 사전 훈련 품질과 관계없이, BERT, RoBERTa, BART, ELECTRA, DeBERTa 등 다섯 가지 다른 사전 훈련된 모델에서 DPS는 일관되게 성능 향상을 보였다.
- 충분한 훈련 데이터가 있는 경우(예: SST-2, QNLI)에도 DPS는 성능 향상을 보였다(예: SST-2에서 +0.54점), 이는 소수의 예제 설정을 넘어서도 강건함을 보였다.
- DPS Dense와 DPS Mix는 각각 훈련 시간이 12%와 30% 증가할 뿐만 아니라, CHILD-TUNING D(313% 오버헤드)보다 훨씬 빠르게 작동했다.
- 다양한 하위넷 크기에서 아블레이션 연구를 통해 DPS는 Mixout 및 CHILD-TUNING D보다 작업 관련 파ram터를 더 효과적으로 포착했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.