Skip to main content
QUICK REVIEW

[논문 리뷰] Distillation Guided Residual Learning for Binary Convolutional Neural Networks

Jianming Ye, Shiliang Zhang|arXiv (Cornell University)|2020. 07. 10.
Advanced Neural Network Applications참고 문헌 36인용 수 7
한 줄 요약

이 논문은 이진 합성곱 신경망(BCNNs)을 위한 디스틸레이션 가속 잔차 학습(DGRL)을 제안한다. 이는 사전 훈련된 전정밀도 CNN에서 블록 단위 지식 디스틸레이션을 통해 중간 특징 맵의 잔차를 최소화하고 훈련을 향상시킨다. 각 블록에 경량의 스위치백 브랜치인 스위치 앤 인터랙션(SI)을 도입하여 잔차 특징을 모델링하며, 파라미터 오버헤드는 10%에 불과하다. ImageNet에서 60.45%의 top-1 정확도를 달성하여 최신 기술보다 뛰어난 성능을 보이며, 높은 효율성을 유지한다.

ABSTRACT

It is challenging to bridge the performance gap between Binary CNN (BCNN) and Floating point CNN (FCNN). We observe that, this performance gap leads to substantial residuals between intermediate feature maps of BCNN and FCNN. To minimize the performance gap, we enforce BCNN to produce similar intermediate feature maps with the ones of FCNN. This training strategy, i.e., optimizing each binary convolutional block with block-wise distillation loss derived from FCNN, leads to a more effective optimization to BCNN. It also motivates us to update the binary convolutional block architecture to facilitate the optimization of block-wise distillation loss. Specifically, a lightweight shortcut branch is inserted into each binary convolutional block to complement residuals at each block. Benefited from its Squeeze-and-Interaction (SI) structure, this shortcut branch introduces a fraction of parameters, e.g., 10\% overheads, but effectively complements the residuals. Extensive experiments on ImageNet demonstrate the superior performance of our method in both classification efficiency and accuracy, e.g., BCNN trained with our methods achieves the accuracy of 60.45\% on ImageNet.

연구 동기 및 목표

  • 이중 합성곱 신경망(BCNNs)과 전정밀도 합성곱 신경망(FCNNs) 사이의 성능 격차를 해소하기 위해, 중간 특징 맵에서 발생하는 상당한 잔차를 줄이기 위함이다.
  • 이진 가중치와 활성화로 인한 기울기 소실과 양자화 오차로 인해 저하되는 BCNN 훈련 효율성과 최적화 안정성을 향상시키기 위함이다.
  • 높은 계산 비용 없이 BCNN의 모델 용량을 향상시키기 위해, 경량 스위치백 브랜치를 도입하여 잔차 특징을 모델링하기 위함이다.
  • FCNN의 지도를 블록 수준에서만 초기화가 아닌, 최적화를 더 효과적으로 이끌기 위해 활용하는 훈련 전략을 개발하기 위함이다.
  • 고성능 추론과 낮은 메모리 사용을 유지하면서 BCNN에서 최신 기술 수준의 정확도를 달성하기 위함이다.

제안 방법

  • 각 이진 합성곱 블록을 사전 훈련된 FCNN의 해당하는 전정밀도 블록의 중간 특징 맵을 따라가도록 블록 단위 지식 디스틸레이션을 적용하여 훈련한다.
  • 각 이진 블록에 스위치 앤 인터랙션(SI) 스위치백 브랜치를 삽입하며, 압축 모듈이 채널 차원을 감소시키고, 상호작용 모듈이 학습된 가중치로 원래의 특징 맵을 복원한다.
  • SI 브랜치는 블록에 따라 다를 수 있는 가중치를 가진 채널 감소 비율을 사용하여 잔차 특징을 적응적으로 모델링하며, 최소한의 파라미터 오버헤드를 유도한다.
  • 훈련 과정은 이진화된 가중치를 추론용으로 업데이트하고, 역전파를 위해 전정밀도 파라미터를 업데이트하는 방식으로 번갈아가며, 각 블록에 디스틸레이션 손실을 적용한다.
  • 최종 출력에 대한 교차 엔트로피 손실과 중간 특징에 대한 블록 단위 디스틸레이션 손실을 조합한 복합 손실을 사용하여 종합적으로 엔드 투 엔드로 훈련한다.
  • 훈련 후 모델 압축을 위해 SI 스위치백 브랜치의 낮은 가중치 채널을 프루닝하여 FLOPs와 모델 크기를 줄이며, 정확도 저하가 거의 없이 효율성을 높인다.

실험 결과

연구 질문

  • RQ1전정밀도 CNN에서의 블록 단위 지식 디스틸레이션을 통해 중간 특징 맵의 잔차를 최소화함으로써, BCNN과 FCNN 사이의 성능 격차를 크게 줄일 수 있는가?
  • RQ2각 블록에 경량의 스위치 앤 인터랙션(SI) 스위치백 브랜치를 도입함으로써, 높은 계산 비용 없이 BCNN의 표현 능력을 향상시킬 수 있는가?
  • RQ3기존의 FCNN 초기화 방식을 사용하는 표준 BCNN 훈련 방식과 비교해 볼 때, 제안된 디스틸레이션 가속 훈련 전략은 정확도와 수렴 속도 측면에서 어떻게 다른가?
  • RQ4작은 파라미터 오버헤드를 고려할 때, SI 스위치백 브랜치는 추론 속도와 모델 효율성에 어떤 영향을 미치는가?
  • RQ5기존 BCNN들과 비교해 볼 때, 제안된 방법은 ImageNet에서 최신 기술 수준의 정확도를 달성하면서도 낮은 FLOPs와 메모리 사용을 유지할 수 있는가?

주요 결과

  • DGRL은 ImageNet에서 60.45%의 top-1 정확도를 달성하여 이전 최고 기록인 CI-BCNN(59.9%)을 0.55% 뛰어넘었다.
  • 블록 단위 디스틸레이션 손실만으로도 베이스라인 BinaryResNetE18의 정확도가 1.40% 향상되어, 최적화에서의 효과를 입증했다.
  • SI 스위치백 브랜치를 추가함으로써, 베이스라인 대비 정확도가 1.73% 향상되어, 잔차 특징을 모델링하는 데서의 기여를 확인했다.
  • SI 스위치백은 베이스라인 대비 FLOPs는 12.9% 증가하고 모델 크기는 5.7% 증가하였지만, 병렬 계산 덕분에 추론 속도는 거의 그대로 유지되었다.
  • CIFAR-10에서 전정밀도 ResNet18 대비 40배 적은 FLOPs와 29배 적은 메모리를 사용하면서도 정확도는 0.58% 뿐 감소하였다.
  • 훈련 후 SI 스위치백 채널을 프루닝함으로써 오버헤드를 추가로 줄였고, 정확도는 60.23%를 유지하여 설계의 효율성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.