Skip to main content
QUICK REVIEW

[논문 리뷰] Reliable Model Compression via Label-Preservation-Aware Loss Functions.

V. Roshan Joseph, Shoaib Ahmed Siddiqui|arXiv (Cornell University)|2020. 12. 03.
Machine Learning and Data Classification참고 문헌 43인용 수 7
한 줄 요약

이 논문은 모델 압축 동안 교사-학생 모델 간의 일치도를 향상시켜 예측 불일치를 감소시키는 라벨 유지 인식 손실 함수를 제안한다. 동적으로 손실 구성 요소를 조정함으로써, 8종의 실제 응용 아키텍처와 다양한 압축 기법을 통해 최대 4.1배 적은 라벨 불일치와 참조 모델이 올바른 예측을 할 경우 최대 5.7배 적은 불일치를 달성한다.

ABSTRACT

Model compression is a ubiquitous tool that brings the power of modern deep learning to edge devices with power and latency constraints. The goal of model compression is to take a large reference neural network and output a smaller and less expensive compressed network that is functionally equivalent to the reference. Compression typically involves pruning and/or quantization, followed by re-training to maintain the reference accuracy. However, it has been observed that compression can lead to a considerable mismatch in the labels produced by the reference and the compressed models, resulting in bias and unreliability. To combat this, we present a framework that uses a teacher-student learning paradigm to better preserve labels. We investigate the role of additional terms to the loss function and show how to automatically tune the associated parameters. We demonstrate the effectiveness of our approach both quantitatively and qualitatively on multiple compression schemes and accuracy recovery algorithms using a set of 8 different real-world network architectures. We obtain a significant reduction of up to 4.1X in the number of mismatches between the compressed and reference models, and up to 5.7X in cases where the reference model makes the correct prediction.

연구 동기 및 목표

  • 모델 압축 과정에서 압축된 모델과 기준 모델 간의 예측 라벨 불일치 문제를 해결하기 위해.
  • 기준 네트워크와의 라벨 일관성을 유지함으로써 압축 모델의 신뢰성과 功能 등가성을 향상시키기 위해.
  • 지식 정복 과정에서 라벨 유지에 명시적으로 장려하는 손실 함수를 개발하기 위해.
  • 다양한 아키텍처와 압축 방법에 최적의 성능을 내기 위해 손실 구성 요소의 하이퍼파rameter를 자동으로 조정하기 위해.
  • 실제 모델에서 다양한 압축 기법과 정확도 복구 알고리즘을 대상으로 방법을 평가하기 위해.

제안 방법

  • 교사-학생 모델 간 예측 일치를 위해 라벨 유지 인식 항목을 포함한 수정된 정복 손실을 도입한다.
  • 라벨 유지 인식 항목에 대해 동적 가중치 메커니즘을 통합하여 학습 도중 정확도와 라벨 일관성 간 균형을 자동으로 조정한다.
  • 프루닝 및/또는 양자화 이후 재학습 과정에서 손실 함수를 적용하여 기능 등가성을 유지한다.
  • 기준 모델을 교사로, 압축된 모델을 학생으로 하는 교사-학생 프레임워크를 사용한다.
  • 기본 분류 손실과 라벨 유지 인식 손실 구성 요소를 동시에 최소화하기 위해 기울기 기반 최적화를 적용한다.
  • 다양한 압축 설정에서 8종의 실제 네트워크 아키텍처에서 접근 방식을 검증한다.

실험 결과

연구 질문

  • RQ1라벨 유지 인식 손실 항목을 통합할 경우, 압축 모델과 기준 모델 간의 예측 일관성은 어떻게 영향을 받는가?
  • RQ2손실 구성 요소의 자동 하이퍼파ram터 조정이 압축 신뢰성에 얼마나 기여하는가?
  • RQ3다양한 압축 기법에서 제안된 방법이 표준 정복 기법과 비교해 라벨 불일치를 얼마나 줄이는가?
  • RQ4예측 불일치를 감소시키는 동안 정확도는 유지되거나 향상되는가?
  • RQ5다양한 네트워크 아키텍처와 압축 기법에서 이 접근 방식은 얼마나 견고한가?

주요 결과

  • 제안된 방법은 기준 방법 대비 압축 모델과 기준 모델 간 예측 불일치 수를 최대 4.1배 감소시킨다.
  • 기준 모델이 올바른 예측을 내릴 경우, 불일치 수는 최대 5.7배 감소한다.
  • 이 방법은 ResNet, DenseNet, EfficientNet 변종을 포함한 모든 8종의 실제 네트워크 아키텍처에서 일관된 향상을 보였다.
  • 손실 구성 요소의 자동 조정은 더 나은 일반화 성능을 이끌어내며 하이퍼파ram터 선택에 대한 민감도를 감소시킨다.
  • 라벨 유지 인식 손실은 정확도를 떨어뜨리지 않고도 신뢰성을 향상시켜 대부분의 경우 상위-1 정확도를 유지하거나 略로 향상시킨다.
  • 정성 분석 결과, 특히 모호하거나 적대적인 예제에서 비정상적인 예측 이동을 감소시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.