Skip to main content
QUICK REVIEW

[논문 리뷰] PLATON: Pruning Large Transformer Models with Upper Confidence Bound of Weight Importance

Qingru Zhang, Simiao Zuo|arXiv (Cornell University)|2022. 06. 25.
Topic Modeling인용 수 11
한 줄 요약

PLATON은 상위 신뢰구간(Upper Confidence Bound, UCB)을 사용하여 민감도의 불확실성을 통합함으로써 가중치 중요도 추정에 불확실성을 고려한 구조적 프루닝 방법을 제안한다. 시간에 따른 변동성에 기반한 불확실성 정량화와 함께 기하급수적 평균을 적용하여 중요도 점수의 변동성을 감소시켜 더 신뢰할 수 있는 프루닝을 가능하게 하며, 특히 고스퍼시티 영역에서 뛰어난 성능을 발휘한다. 이로 인해 SQuAD에서 90% 스퍼시티일 때 F1 점수에 5% 이상의 향상이 이루어졌다.

ABSTRACT

Large Transformer-based models have exhibited superior performance in various natural language processing and computer vision tasks. However, these models contain enormous amounts of parameters, which restrict their deployment to real-world applications. To reduce the model size, researchers prune these models based on the weights' importance scores. However, such scores are usually estimated on mini-batches during training, which incurs large variability/uncertainty due to mini-batch sampling and complicated training dynamics. As a result, some crucial weights could be pruned by commonly used pruning methods because of such uncertainty, which makes training unstable and hurts generalization. To resolve this issue, we propose PLATON, which captures the uncertainty of importance scores by upper confidence bound (UCB) of importance estimation. In particular, for the weights with low importance scores but high uncertainty, PLATON tends to retain them and explores their capacity. We conduct extensive experiments with several Transformer-based models on natural language understanding, question answering and image classification to validate the effectiveness of PLATON. Results demonstrate that PLATON manifests notable improvement under different sparsity levels. Our code is publicly available at https://github.com/QingruZhang/PLATON.

연구 동기 및 목표

  • 미니배치에서 추정한 중요도 점수의 높은 변동성으로 인한 반복적 프루닝에서의 훈련 불안정성 문제를 해결하기 위해.
  • 훈련 중 민감도 추정이 노이즈로 인해 중요한 가중치가 잘못 프루닝되는 위험을 줄이기 위해.
  • 대규모 트랜스포머 모델의 고스퍼시티 프루닝 영역에서 일반화 능력과 안정성을 향상시키기 위해.
  • 불확실성이 높은 낮은 중요도 가중치의 탐색과 높은 중요도 가중치의 활용을 균형 있게 조절할 수 있는 방법을 개발하기 위해.
  • 그룹 수준의 민감도 점수에 대한 불확실성 정량화를 통해 더 신뢰할 수 있는 구조적 프루닝을 가능하게 하기 위해.

제안 방법

  • PLATON은 가중치 기울기와 가중치 값 간의 내적의 절대값으로 민감도를 계산한다: $ I = |\theta^\top \nabla_\theta \mathcal{L}(\theta) | $.
  • 시간에 따른 민감도를 부드럽게 하기 위해 기하급수적 이동 평균(EMA)을 적용한다: $ \overline{I}^{(t+1)} = \beta_1 \overline{I}^{(t)} + (1 - \beta_1) I^{(t)} $.
  • 불확실성은 부드러운 민감도에서의 절대 편차로 정량화한다: $ U^{(t)} = |I^{(t)} - \overline{I}^{(t)}| $.
  • 두 번째 EMA를 불확실성에 적용한다: $ \overline{U}^{(t+1)} = \beta_2 \overline{U}^{(t)} + (1 - \beta_2) U^{(t)} $.
  • 최종 중요도 점수는 부드러운 민감도와 불확실성의 곱으로 계산한다: $ S^{(t)} = \overline{I}^{(t)} \cdot \overline{U}^{(t)} $.
  • 중요도 점수가 가장 낮은 가중치 또는 그룹을 제거함으로써 프루닝을 수행하며, 상위 r% 선택 전략을 사용한다.

실험 결과

연구 질문

  • RQ1중요도 점수 추정의 불확실성을 효과적으로 모델링하여 대규모 트랜스포머 모델에서 프루닝의 안정성을 향상시킬 수 있는가?
  • RQ2상위 신뢰구간(Upper Confidence Bound)을 통해 불확실성을 통합하면 반복적 프루닝 중 민감도 점수의 변동성을 줄일 수 있는가?
  • RQ3UCB 기반 중요도 점수가 고스퍼시티 프루닝 환경에서 기존의 표준 민감도 또는 크기 기반 메트릭보다 우수한 성능을 낼 수 있는가?
  • RQ4구조적 프루닝, 즉 전체 그룹(예: 열)을 함께 제거하는 상황에서 제안된 방법은 어떻게 성능을 발휘하는가?
  • RQ5기존의 반복적 프루닝 기반 방법과 비교해 본다면, 이 방법은 훈련 불안정성을 얼마나 줄이고 일반화 능력을 얼마나 향상시키는가?

주요 결과

  • DeBERTaV3-base를 90% 스퍼시티로 프루닝할 때 SQuAD v1.1 벤치마크에서 F1 점수에 5.0% 이상의 향상이 이루어졌으며, 이는 이전 방법들보다 뚜렷이 뛰어난 성능을 보였다.
  • SQuAD v1.1에 대해 미세튜닝된 BERT-base에서 PLATON은 나머지 파rameter가 50%일 때도 78.5% EM과 87.2% F1을 유지하며, 기준 방법들을 능가했다.
  • 표준 민감도 기반 프루닝과 비교해 PLATON의 중요도 점수 변동성이 크게 감소했으며, 그림 1(하단)에서 이를 확인할 수 있었고, 이는 더 안정적인 훈련을 가능하게 했다.
  • 기존의 반복적 프루닝 방법들(예: movement pruning)과 비교해 PLATON의 훈련 과정은 더 안정적이며 하이퍼파ram터 선택에 덜 민감했다.
  • 구조적 프루닝 상황에서 PLATON은 SQuAD v1.1에서 나머지 파rameter가 40%일 때 78.0% EM과 86.9% F1을 기록했으며, 비구조적 기준 방법들을 능가했다.
  • 높은 불확실성과 낮은 민감도를 가진 가중치를 유지함으로써 중요한 가중치가 조기 프루닝되는 것을 효과적으로 방지하여 모델 용량 탐색을 더 잘 수행할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.