Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey on Model Compression and Acceleration for Pretrained Language Models

Canwen Xu, Julian McAuley|arXiv (Cornell University)|2022. 02. 15.
Topic Modeling인용 수 8
한 줄 요약

이 종합 검토는 사전 학습된 언어 모델(PLMs)을 위한 모델 압축 및 가속 기법에 대한 종합적인 리뷰를 제공하며, 절단, 양자화, 지식 증류, 동적 추론 등의 방법을 중심으로 계산 비용, 메모리 사용량, 탄소 배출량을 줄이는 데 중점을 둔다. 통합된 분류 체계, 벤치마크, 메트릭스를 도입하면서 평가, 내성, 자동화 문제를 부각시키며 지속 가능하고 포괄적인 NLP 배포를 위한 필요성을 주장한다.

ABSTRACT

Despite achieving state-of-the-art performance on many NLP tasks, the high energy cost and long inference delay prevent Transformer-based pretrained language models (PLMs) from seeing broader adoption including for edge and mobile computing. Efficient NLP research aims to comprehensively consider computation, time and carbon emission for the entire life-cycle of NLP, including data preparation, model training and inference. In this survey, we focus on the inference stage and review the current state of model compression and acceleration for pretrained language models, including benchmarks, metrics and methodology.

연구 동기 및 목표

  • 사전 학습된 언어 모델(PLMs)을 위한 모델 압축 및 가속 기법에 대한 체계적인 리뷰를 제공하여 추론 효율성을 향상시키는 것.
  • 절단, 양자화, 지식 증류, 동적 추론 등을 포함한 기존 기법들을 통합된 분류 체계로 정리하는 것.
  • FLOPs, 추론 시간, 속도 향상 비율, 모델 크기, 탄소 배출량 등의 표준 메트릭스를 사용하여 기법들을 평가하고 비교하는 것.
  • 평가, 내성, 인간 의존성 문제를 특정하고, 더 설명 가능하고 내성적이며 자동화된 압축 기법의 필요성을 주장하는 것.
  • 대규모 PLMs의 환경적 및 하드웨어적 장벽을 줄여 지속 가능하고 포용적인 NLP 배포를 촉진하는 것.

제안 방법

  • 주요 압축 기법인 가중치 공유, 낮은 질량 분해, 절단, 양자화, 지식 증류, 조기 종료, 토큰 스킵을 분류하고 분석하는 것.
  • FLOPs, 추론 시간, 속도 향상 비율, 모델 크기, 탄소 배출량, 충실도, 내성도 등을 포함한 메트릭스를 도입하고 평가하는 것.
  • 작업, 하드웨어, 제약 조건에 따라 적절한 기법을 선택할 수 있도록 도와주는 决책 트리(그림 2)를 제안하는 것.
  • 주의 점수 기반 또는 학습된 메커니즘을 사용해 토큰을 스킵하는 동적 추론 기법인 PoWER-BERT, TR-BERT, LAT, LTP, Transkimmer 등을 검토하는 것.
  • 지식 증류 + 절단 등의 기법 조합이 정확도와 속도 면에서 더 나은 파레토 효율성을 달성할 수 있음을 강조하는 것.
  • 압축 하이퍼파ram터 선택의 자동화를 위해 메타러닝 및 신경망 아키텍처 탐색 기반의 향후 연구 필요성을 제기하는 것.

실험 결과

연구 질문

  • RQ1PLMs에 적용되는 모델 압축 및 가속 기법 중 정확도, 속도, 모델 크기 간 최적의 트레이드오프를 제공하는 기법은 무엇인가?
  • RQ2표준화된 벤치마크와 메트릭스는 다양한 연구 간 압축 기법의 비교 가능성을 어떻게 향상시킬 수 있는가?
  • RQ3압축이 모델의 내성 및 적대적 공격에 대한 취약성에 미치는 영향은 무엇인가?
  • RQ4생산 환경 배포를 지원하기 위해 압축 모델의 설명 가능성과 신뢰도는 어떻게 향상시킬 수 있는가?
  • RQ5메타러닝이나 신경망 아키텍처 탐색과 같은 자동화 기법은 모델 압축 과정에서 인간의 노력을 어떻게 줄일 수 있는가?

주요 결과

  • 지식 증류, 절단, 양자화 등의 모델 압축 기법은 정확도 저하를 최소화하면서 모델 크기와 추론 시간을 줄일 수 있다.
  • PoWER-BERT와 TR-BERT와 같은 동적 추론 기법은 주의 점수 기반으로 토큰을 스킵하는 방식을 통해 더 나은 정확도-속도 트레이드오프를 달성한다.
  • CodeCarbon와 Experiment Impact Tracker와 같은 탄소 배출량 추정 도구는 모델 훈련 및 배포의 환경적 영향 평가에 필수적이다.
  • 충실도 및 충성도 메트릭스는 지식 증류 기반 압축에서 지식 이행 품질을 해석 가능한 방식으로 측정할 수 있다.
  • 지식 증류 + 절단 등의 다중 기법 조합은 단일 기법 대비 더 뛰어난 성능과 효율성을 보여주는 경우가 많다.
  • 현재 평가 관행은 표준화되어 있지 않아, 특히 다양한 하드웨어와 작업 간 비교가 어려운 상황이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.