[논문 리뷰] TernaryBERT: Distillation-aware Ultra-low Bit BERT
TernaryBERT는 단일화된 BERT 가중치를 {-1, 0, +1}로 삼항화하고, 단어 임bedding과 Transformer 레이어에 대해 혼합된 해상도로 적용하는, 지식 정규화를 고려한 초저비트 양자화 방법을 제안한다. 이는 근사 기반 및 손실 기반 삼항화를 모두 활용한다. 전체 정밀도 BERT와 유사한 성능을 달성하면서 모델 크기를 14.9배 작게 줄이며, GLUE 및 SQuAD 벤치마크에서 기존의 양자화 및 압축 방법들을 능가한다.
Transformer-based pre-training models like BERT have achieved remarkable performance in many natural language processing tasks.However, these models are both computation and memory expensive, hindering their deployment to resource-constrained devices. In this work, we propose TernaryBERT, which ternarizes the weights in a fine-tuned BERT model. Specifically, we use both approximation-based and loss-aware ternarization methods and empirically investigate the ternarization granularity of different parts of BERT. Moreover, to reduce the accuracy degradation caused by the lower capacity of low bits, we leverage the knowledge distillation technique in the training process. Experiments on the GLUE benchmark and SQuAD show that our proposed TernaryBERT outperforms the other BERT quantization methods, and even achieves comparable performance as the full-precision model while being 14.9x smaller.
연구 동기 및 목표
- 자원 제약이 있는 장치에서 전체 정밀도 BERT 모델의 높은 계산 및 메모리 비용을 해결하기 위해.
- 초저비트 양자화(예: 1-2비트)에서의 정확도 저하를 줄이기 위해 삼항화와 지식 정규화를 융합함으로써.
- 단어 임베딩과 Transformer 레이어와 같은 BERT의 다양한 구성 요소에 대해 최적의 삼항화 해상도를 조사하기 위해.
- 삼항 가중치 제약으로 인한 모델 용량 감소에도 불구하고 높은 성능을 유지할 수 있는 방법을 개발하기 위해.
제안 방법
- 근사 기반 및 손실 기반의 양자화 전략을 모두 사용하여 BERT 가중치를 {-1, 0, +1}로 삼항화한다.
- Transformer 가중치에는 레이어 단위의 삼항화 해상도를, 단어 임베딩에는 헤드 단위의 삼항화 해상도를 적용한다.
- 전체 정밀도 교사 모델로부터의 지식 정규화를 통합하여 삼항화된 학생 모델의 학습을 이끌어낸다.
- 출력 로짓 외에도 중간 표현과 어텐션 맵에 지식 정규화 손실을 적용하여 지식을 유지한다.
- 교차 엔트로피 손실과 지식 정규화 손실을 조합한 하이브리드 학습 목표 함수를 사용하여 일반화 성능을 향상시킨다.
- 비교 및 분석을 위해 손실 기반 양자화(LAQ)를 활용해 3비트 양자화로 방법을 확장한다.
실험 결과
연구 질문
- RQ1BERT 가중치의 삼항 양자화가 모델 크기를 크게 줄이면서도 전체 정밀도 BERT와 유사한 성능을 달성할 수 있는가?
- RQ2레이어 단위 vs. 헤드 단위의 삼항화 해상도 선택이 BERT의 다양한 구성 요소에서 정확도에 어떤 영향을 미치는가?
- RQ3지식 정규화가 초저비트 양자화된 BERT 모델에서 정확도 저하를 얼마나 효과적으로 완화하는가?
- RQ4다양한 지식 정규화 손실(로짓, 중간 특징, 어텐션 맵)이 삼항화된 BERT의 성능 향상에 기여하는 정도는 어떠한가?
- RQ5정확도와 모델 크기 측면에서 TernaryBERT는 최신의 양자화 및 압축 방법들과 비교해 어떻게 성능을 냅니다?
주요 결과
- TernaryBERT는 28MB의 모델 크기로 MNLI-m 정확도 83.5%를 달성하여 전체 정밀도 BERT 대비 14.9배 작아졌다.
- 2비트 가중치를 사용하는 혼합 정밀도 Q-BERT 및 GOBO보다 높은 정확도를 달성하여 MNLI 및 SQuAD 벤치마크에서 모두 승리했다.
- 지식 정규화가 성능 향상에 크게 기여한다: Transformer 레이어와 로짓 모두에서 정규화를 제거하면 MNLI-m 정확도가 5% 이상 감소한다.
- 중간 표현과 어텐션 맵에 지식 정규화를 적용할 경우, 단지 로짓에만 의존하는 것보다 성능 향상이 더 크다.
- 데이터 증강과 미세조정된 BERT 초기화가 성능 향상에 기여하며, 특히 CoLA와 RTE에서 두 가지 기법을 모두 적용할 경우 CoLA에서 최대 9.7% 향상된다.
- TernaryBERT는 SQuAD v1.1에서 전체 정밀도 BERT와 유사한 성능(87.4/87.4 F1)을 달성하면서도 모델 크기를 14.9배 줄여 강력한 압축 효율성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.