Skip to main content
QUICK REVIEW

[논문 리뷰] Robustness Challenges in Model Distillation and Pruning for Natural Language Understanding

Mengnan Du, Subhabrata Mukherjee|arXiv (Cornell University)|2021. 10. 16.
Topic Modeling참고 문헌 50인용 수 4
한 줄 요약

이 논문은 지식 정복과 프루닝을 통한 NLP 모델 압축이 강력한 내분포 성능에도 불구하고 분포 외(OOD)에 대한 강건성을 저하시킨다는 점을 규명한다. 본 논문은 샘플의 불확실성을 활용해 훈련을 스무딩하는 정규화 프레임워크인 RMC를 제안하며, 이는 쉽게 접근 가능한/단순한 샘플에 대한 과적합을 줄임으로써 내분포 정확도를 희생시키지 않고 OOD 일반화 성능을 향상시킨다. 다양한 NLU 작업에서 검증된 바 있다.

ABSTRACT

Recent work has focused on compressing pre-trained language models (PLMs) like BERT where the major focus has been to improve the in-distribution performance for downstream tasks. However, very few of these studies have analyzed the impact of compression on the generalizability and robustness of compressed models for out-of-distribution (OOD) data. Towards this end, we study two popular model compression techniques including knowledge distillation and pruning and show that the compressed models are significantly less robust than their PLM counterparts on OOD test sets although they obtain similar performance on in-distribution development sets for a task. Further analysis indicates that the compressed models overfit on the shortcut samples and generalize poorly on the hard ones. We further leverage this observation to develop a regularization strategy for robust model compression based on sample uncertainty. Experimental results on several natural language understanding tasks demonstrate that our bias mitigation framework improves the OOD generalization of the compressed models, while not sacrificing the in-distribution task performance.

연구 동기 및 목표

  • 지식 정복과 프루닝을 통해 압축된 모델이 전체 크기의 사전학습된 언어 모델(PLM)과 비교해 분포 외(OOD) 데이터에서 강건성을 유지하는지 조사하기 위해.
  • 압축된 모델이 분포 외 데이터에서 일반화 성능이 떨어지는 이유를 분석하며, 특히 쉽게 접근 가능한 또는 단순한 샘플에 과적합하는 경향을 규명하기 위해.
  • 모델 압축 기간 동안 OOD 일반화 성능을 향상시키면서도 내분포 성능를 유지하는 일반적인 목적의 정규화 프레임워크를 개발하기 위해.
  • 압축 수준이 편향과 강건성에 미치는 영향을 정량화하기 위해, 특히 샘플의 어려움과의 관계를 고려하여.

제안 방법

  • 프루닝된 교사 모델의 다수의 하위 네트워크에서 유도된 예측 분산을 사용해 샘플의 어려움을 추정한다.
  • 이 불확실성 측정값을 샘플별 가중치 요소로 사용해 지식 정복과 피니터닝 과정을 스무딩한다.
  • 추정된 샘플 불확실성 기반으로 손실 가중치를 조정함으로써 정규화된 손실 함수를 사용해 지식 정복 및 프루닝 과정에서 개별 샘플 스무딩을 적용한다.
  • 불확실성 기반 정규화를 지식 정복 및 반복적 크기 기반 프루닝 파ip라인에 통합한다.
  • 내분포 정확도를 훼손하지 않으면서 쉽게 접근 가능한/단순한 샘플에 대한 과적합을 줄이고, 어려운 샘플에 대한 학습을 향상시키기 위해 불확실성 인식 손실 함수를 사용해 압축된 모델을 훈련시킨다.
  • 표준 내분포 및 OOD 테스트 세트를 사용해 다양한 NLU 작업에서 프레임워크를 평가하며, HANS 및 텍스트 함의성 벤치마크를 포함한다.

실험 결과

연구 질문

  • RQ1압축된 모델은 분포 외(OOD) 테스트 세트에서 사전학습된 언어 모델(PLM)과 같은 강건성을 유지하는가?
  • RQ2압축 수준을 다양하게 조절할 경우, 압축된 모델의 OOD 일반화 성능와 편향에 어떤 영향을 미치는가?
  • RQ3샘플의 불확실성을 활용해 모델 압축을 정규화하고, 다양한 어려움 수준의 샘플에서 일반화 성능을 향상시킬 수 있는가?
  • RQ4불확실성 기반 스무딩은 쉽게 접근 가능한/단순한 샘플에 대한 과적합을 줄이고, 어려운 샘플에서의 성능 향상을 이끌 수 있는가?

주요 결과

  • MNLI 작업에서 RMC는 기존의 피니터링 대비 HANS 벤치마크에서 OOD 일반화 정확도를 최대 6.9%p 향상시켰으며, 모든 스파arsity 수준에서 일관된 성과를 보였다.
  • 반복적 크기 기반 프루닝에서 RMC는 기존 테이닝 대비 상대적 편향 지표 $\mathcal{F}_{\text{bias}}$ 를 10% 감소시켰고, 지식 정복에서는 10.4% 감소시켰다.
  • MNLI 작업에서 지식 정복 하에 RMC는 40% 스파arsity에서 어려운 샘플과 쉽게 접근 가능한 샘플 간 성능 격차를 11.3% 감소시켰고, 프루닝 하에선 10.6% 감소시켰다.
  • QQP 작업에서 RMC는 내분포 개발 세트와 OOD 테스트 세트 양쪽에서 성능을 향상시켰으며, 표준 성능에 대한 상충관계가 없음을 보였다.
  • 압축된 모델은 일관되게 전체 PLM보다 OOD 데이터에서 성능이 열 劣하며, 단순하거나 쉽게 접근 가능한 샘플에 대해 심각한 과적합이 관찰되었고, 어려운 샘플에 대한 일반화 능력이 열 劣하였다.
  • 제안된 불확실성 기반 정규화는 쉽게 접근 가능한 샘플에 대한 과적합을 효과적으로 완화하고 어려운 샘플에 대한 학습을 향상시켜 전체적인 강건성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.