Skip to main content
QUICK REVIEW

[논문 리뷰] LIT: Block-wise Intermediate Representation Training for Model Compression

Animesh Koratana, Daniel Kang|arXiv (Cornell University)|2018. 10. 02.
Advanced Neural Network Applications참고 문헌 25인용 수 13
한 줄 요약

LIT는 더 넓고 깊은 교사 네트워크의 중간 표현(Intermediate Representations, IRs)을 블록 단위로 매칭하여 더 얕고 좁은 학생 네트워크를 훈련시키는 새로운 모델 압축 기법이다. 교사의 IR을 각 학생 블록의 입력으로 사용함으로써 훈련을 안정화시키고, ResNeXt나 VDCNN과 같은 현대적 아키텍처를 최대 5.5배까지 압축하면서 정확도 손실 없이 구현하며, 지식 증류(Knowledge Distillation, KD)와 힌트 훈련(Hint Training)을 능가한다. 또한 GAN 생성기로의 응용을 처음으로 확장한다.

ABSTRACT

Knowledge distillation (KD) is a popular method for reducing the computational overhead of deep network inference, in which the output of a teacher model is used to train a smaller, faster student model. Hint training (i.e., FitNets) extends KD by regressing a student model's intermediate representation to a teacher model's intermediate representation. In this work, we introduce bLock-wise Intermediate representation Training (LIT), a novel model compression technique that extends the use of intermediate representations in deep network compression, outperforming KD and hint training. LIT has two key ideas: 1) LIT trains a student of the same width (but shallower depth) as the teacher by directly comparing the intermediate representations, and 2) LIT uses the intermediate representation from the previous block in the teacher model as an input to the current student block during training, avoiding unstable intermediate representations in the student network. We show that LIT provides substantial reductions in network depth without loss in accuracy -- for example, LIT can compress a ResNeXt-110 to a ResNeXt-20 (5.5x) on CIFAR10 and a VDCNN-29 to a VDCNN-9 (3.2x) on Amazon Reviews without loss in accuracy, outperforming KD and hint training in network size for a given accuracy. We also show that applying LIT to identical student/teacher architectures increases the accuracy of the student model above the teacher model, outperforming the recently-proposed Born Again Networks procedure on ResNet, ResNeXt, and VDCNN. Finally, we show that LIT can effectively compress GAN generators, which are not supported in the KD framework because GANs output pixels as opposed to probabilities.

연구 동기 및 목표

  • 지식 증류 과정에서 깊은 학생 네트워크의 중간 표현(IRs)의 불안정성을 해결한다.
  • 기본적인 힌트 훈련이나 KD로 잘 압축되지 않는 현대적이고 고도로 구조화된 딥 네트워크(예: ResNeXt, VDCNN)에 대한 효과적인 압축을 가능하게 한다.
  • 픽셀 수준의 출력을 내보내는 GAN 생성기와 같은 모델에 대해 학생/교사 훈련을 확장한다. 이는 기존 KD와의 호환성 문제로 인해 어려웠다.
  • 교사 네트워크의 일부를 직접 복사하고, 교사의 IR을 학생 블록의 입력으로 사용함으로써 고정확도의 소형 학생 모델을 구현한다.
  • 학생과 교사의 아키텍처가 동일할 경우, LIT가 교사 모델의 정확도를 초월할 수 있음을 입증한다.

제안 방법

  • 교사와 동일한 너비를 가지지만 깊이가 감소한 학생 네트워크를 훈련시키며, 블록 단위의 중간 표현(IR) 매칭을 수행한다.
  • 훈련 중 각 학생 블록에 이전 블록의 교사 IR을 입력으로 사용하여 내부 표현을 안정화시킨다.
  • 로짓과 IR 감시를 균형 있게 조절하기 위해 가중치 인터폴레이션 요소 β를 사용해 지식 증류(KD) 손실과 IR 매칭 손실을 조합한다.
  • 학습 중 학생과 교사 네트워크의 대응 블록 간에 IR 손실을 적용하여 너비와 특징 맵 호환성을 확보한다.
  • 교사에서 그대로 복사된 블록을 학생에 통합함으로써 선택적 압축을 허용하여 모듈러한 모델 압축을 가능하게 한다.
  • 잔차 블록에서 IR을 매칭함으로써 GAN 생성기의 압축을 지원하며, 기존 KD가 픽셀 수준 출력과 호환되지 않는 문제를 우회한다.

실험 결과

연구 질문

  • RQ1표준 힌트 훈련이 불안정한 IR로 인해 실패하는 현대적이고 매우 깊은 네트워크(예: ResNeXt, VDCNN)에 대해 중간 표현 매칭을 효과적으로 확장할 수 있는가?
  • RQ2교사가 제공하는 IR을 입력으로 사용하는 블록 단위의 IR 훈련이, 표준 KD나 힌트 훈련에 비해 학생 모델의 정확도와 일반화 능력을 향상시키는가?
  • RQ3기존 KD와 호환되지 않는 픽셀 수준의 출력을 내보내는 GAN 생성기의 압축을 LIT가 가능하게 하는가?
  • RQ4학생과 교사의 아키텍처가 동일할 경우, LIT가 학생 모델의 정확도를 교사 모델을 초월할 수 있는가?
  • RQ5LIT의 성능은 β(IRM 손실 가중치)와 α(KD 손실 가중치)와 같은 하이퍼파라미터에 얼마나 민감한가? 최적의 설정은 무엇인가?

주요 결과

  • LIT는 CIFAR10에서 ResNeXt-110을 ResNeXt-20(5.5배 압축)으로 압축하면서 정확도 손실 없이 기존 KD와 힌트 훈련을 능가한다.
  • LIT는 Amazon Reviews 데이터셋에서 VDCNN-29를 VDCNN-9(3.2배 압축)로 압축하면서 정확도 저하 없이 NLP 작업에 효과적임을 입증한다.
  • 동일한 아키텍처로 압축할 경우, LIT는 ResNet, ResNeXt, VDCNN에서 교사 모델을 초월하는 학생 모델의 정확도를 달성하며, Born Again Networks를 능가한다.
  • LIT는 잔차 블록에서 IR을 매칭함으로써 GAN 생성기의 압축을 가능하게 하여, GAN에 적용 가능한 첫 번째 학생/교사 방법이 되었다.
  • L1과 L2 손실에 비해 부드러운 L1 손실은 정확도를 저하시키며, L1과 L2 간에는 성능 차이가 없었다.
  • 혼합 정밀도 훈련은 LIT 성능에 거의 영향을 주지 않으며, ResNeXt에서 정확도가 0.06% 뿐 감소함을 확인하여 현대 훈련 기법과의 호환성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.