[논문 리뷰] Contrastive Distillation on Intermediate Representations for Language Model Compression
이 논문은 중간 표현을 통한 대조적 목적을 활용하여 압축된 언어 모델에서 지식 정복을 향상시키는 대조적 정복 프레임워크 CoDIR를 제안한다. GLUE 벤치마크에서 기존 방법들을 능가하며, 더 작고 빠른 모델로도 성능을 향상시킨다.
Existing language model compression methods mostly use a simple L2 loss to distill knowledge in the intermediate representations of a large BERT model to a smaller one. Although widely used, this objective by design assumes that all the dimensions of hidden representations are independent, failing to capture important structural knowledge in the intermediate layers of the teacher network. To achieve better distillation efficacy, we propose Contrastive Distillation on Intermediate Representations (CoDIR), a principled knowledge distillation framework where the student is trained to distill knowledge through intermediate layers of the teacher via a contrastive objective. By learning to distinguish positive sample from a large set of negative samples, CoDIR facilitates the student's exploitation of rich information in teacher's hidden layers. CoDIR can be readily applied to compress large-scale language models in both pre-training and finetuning stages, and achieves superb performance on the GLUE benchmark, outperforming state-of-the-art compression methods.
연구 동기 및 목표
- BERT의 중간 레이어에서의 구조적 종속성을 포착하지 못하는 기존 지식 정복의 한계를 해결하기 위해, 은닉 표현 간의 독립적인 $L_2$ 손실에 의존하는 방법의 문제점을 해결한다.
- 대규모 언어 모델의 지식 정복에 대조 학습을 활용하는 것의 가능성을 탐색하며, 특히 중간 표현 내의 고차원 관계를 효과적으로 활용하는 방법을 모색한다.
- 사용자 레이블이 없거나 희박한 상황에서, 사전 훈련 및 미세조정 단계 모두에서 효과적인 샘플링 전략을 설계한다.
- 표준 $L_2$ 정복을 대체하여, 동일한 샘플(일치하는 쌍)과 다른 샘플(비일치하는 쌍)의 표현 쌍을 구별하는 대조적 목적을 도입함으로써 모델의 효율성과 성능을 향상시킨다.
- 미세조정 단계에서 [CLS] 토큰보다 평균 풀링된 표현이 더 효과적임을 입증하며, 특히 미세조정 단계에서의 정복 성능 향상에 기여한다.
제안 방법
- CoDIR는 교사 및 학습자 네트워크의 중간 은닉 표현에 대조 손실을 적용하여, 동일한 입력에서 유래한 표현 쌍(일치하는 쌍)과 다른 입력에서 유래한 표현 쌍(비일치하는 쌍)을 학습자 모델이 구별하도록 한다.
- 대조 목적은 동일 샘플에서 유래한 표현(양성 쌍)을 끌어당기고, 다른 샘플에서 유래한 표현(음성 쌍)을 밀어내는 대조 학습 손실로 수식화된다.
- 사전 훈련 단계에서 레이블이 제공되지 않는 상황에서도 효율적인 음성 샘플링을 가능하게 하기 위해, 현재 배치의 모든 표현을 저장하는 메모리 백업을 사용한다.
- 미세조정 단계에서는 서로 다른 레이블을 가진 샘플을 사용해 비일치 쌍을 구성하여 상이성을 극대화하고, 사전 훈련 단계에서는 동일한 미니배치에서 무작위로 선택한 쌍을 대체로 사용한다.
- 사전 훈련 기간 동안 대조적 정복과 표준 지식 정복(KL 발산 로그리티스) 및 마스크된 언어 모델링(MLM) 손실을 결합한다.
- 정복을 위한 문장 수준의 임베딩으로 모든 토큰 표현의 평균 풀링을 사용하며, [CLS] 토큰을 대체한다. 이는 경험적으로 더 효과적임을 입증하였다.
실험 결과
연구 질문
- RQ1표준 $L_2$ 기반 정복과 비교해 볼 때, 중간 표현에 대한 대조 학습이 압축된 언어 모델의 지식 정복을 향상시키는가?
- RQ2사전 훈련 단계에서 레이블이 제공되지 않는 상황에서도 효과적인 음성 샘플링 전략을 사전 훈련 및 미세조정 단계 모두에 적용할 수 있는가?
- RQ3[CLS] 토큰 대신 평균 풀링된 표현을 사용할 경우, 압축된 모델에서 정복 성능이 향상되는가?
- RQ4음성 샘플의 수가 언어 모델 압축 맥락에서 대조적 정복의 성능에 미치는 영향은 무엇인가?
- RQ5제안된 CoDIR 프레임워크는 기존의 압축 방법과 비교해 모델 크기와 추론 시간을 줄이며 GLUE에서 최고 성능을 달성할 수 있는가?
주요 결과
- CoDIR는 GLUE 벤치마크에서 최신 압축 기법들을 능가하며, 표준 MLM 사전 훈련 대비 평균 1.9% 향상되고, KD 전용 사전 훈련 대비 1.0% 향상된 성능을 기록했다.
- BERT-base 크기의 절반인 학습자 모델이 2배 더 빠른 추론 속도를 기록하며 경쟁 가능한 성능을 달성했으며, GPU 요구량도 감소했다.
- 정복 타겟으로 평균 풀링된 표현을 사용할 경우, 평균 GLUE 점수 83.0을 기록하여 [CLS] 토큰 기반 정복(평균 점수 82.5)을 능가했다.
- 음성 샘플 수를 100에서 1000으로 늘일수록 대부분의 GLUE 작업에서 성능 향상이 관찰되었으며, 특히 MNLI와 QNLI에서 가장 큰 향상이 있었다.
- 대조 손실은 성능 향상에 기여하는 데 핵심적인 역할을 했다: 표준 KD에 CRD 손실을 추가하면 평균 GLUE 점수를 1.0% 향상시키며, 순수한 MLM 사전 훈련 대비 1.9% 향상되었다.
- 작은 데이터셋(CoLA, MRPC, RTE)에서는 성능의 변동성이 더 높았으며, 표준편차가 약 1.5 수준이었고, 이는 무작위 초기화에 민감함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.