[논문 리뷰] Training convolutional neural networks with cheap convolutions and online distillation
이 논문은 아키텍처 재설계 없이 깊이 분할, 그룹, 이동 합성곱과 같은 저비용 합성곱을 사용하여 컨volutional 신경망(CNNs)을 압축하기 위한 새로운 온라인 디스틸레이션(OD) 방법을 제안한다. 저비용 합성곱을 사용하는 학생 네트워크를 훈련하고 온라인 특징 연결 및 상호 학습을 통해 동적으로 강력한 교사 네트워크를 생성함으로써, 상태의 기술을 달성하면서 정확도 손실를 최소화한다. ImageNet에서 최대 5.66배의 FLOPs 감소를 이룩하면서도 높은 정확도를 유지한다.
The large memory and computation consumption in convolutional neural networks (CNNs) has been one of the main barriers for deploying them on resource-limited systems. To this end, most cheap convolutions (e.g., group convolution, depth-wise convolution, and shift convolution) have recently been used for memory and computation reduction but with the specific architecture designing. Furthermore, it results in a low discriminability of the compressed networks by directly replacing the standard convolution with these cheap ones. In this paper, we propose to use knowledge distillation to improve the performance of the compact student networks with cheap convolutions. In our case, the teacher is a network with the standard convolution, while the student is a simple transformation of the teacher architecture without complicated redesigning. In particular, we propose a novel online distillation method, which online constructs the teacher network without pre-training and conducts mutual learning between the teacher and student network, to improve the performance of the student model. Extensive experiments demonstrate that the proposed approach achieves superior performance to simultaneously reduce memory and computation overhead of cutting-edge CNNs on different datasets, including CIFAR-10/100 and ImageNet ILSVRC 2012, compared to the state-of-the-art CNN compression and acceleration methods. The codes are publicly available at https://github.com/EthanZhangYC/OD-cheap-convolution.
연구 동기 및 목표
- 자원 제한된 디바이스에서 큰 CNN의 높은 메모리 및 계산 비용 문제를 해결하기 위해.
- 초기 학습 시 낮은 분류 능력을 보이는 저비용 합성곱을 사용하는 컴팩트한 학생 네트워크의 성능을 향상시키기 위해.
- 사전 훈련된 교사나 다단계 훈련이 필요 없도록, 학생과 동적으로 생성된 교사 네트워크 간의 온라인 상호 학습을 가능하게 하여 지식 디스틸레이션의 필요성을 제거하기 위해.
- 표준 합성곱을 저비용 합성곱으로 대체하고 온라인 디스틸레이션을 통해 성능을 향상시키는 플러그 앤 플레이 방식을 통해 효과적인 CNN 압축 및 가속화를 달성하기 위해.
제안 방법
- 기존 아키텍처(예: ResNet, DenseNet)의 표준 합성곱을 깊이 분할, 그룹, 또는 이동 합성곱과 같은 저비용 합성곱으로 대체하여 학생 네트워크를 구성한다.
- 훈련 중에 여러 학생 네트워크의 특징 맵을 연결하고 새로운 분류기 추가를 통해 온라인 교사를 구성함으로써 동적 지식 전달을 가능하게 한다.
- 학습 중에 학생과 온라인 교사 간의 상호 학습을 수행하여 양측이 공유된 지식을 통해 함께 향상된다.
- 사전 훈련 없이 실시간으로 교사를 생성함으로써 단계별 미세조정 없이 종단 간 최적화를 가능하게 한다.
- ResNet-18, ResNet-50, MobileNet V2 등 다양한 아키텍처에 플러그 앤 플레이 방식으로 구현 가능하다.
- CIFAR-10/100 및 ImageNet ILSVRC 2012에서 평가하여 데이터셋 및 모델 간 일관된 성능 향상을 입증한다.
실험 결과
연구 질문
- RQ1아키텍처 재설계 없이 저비용 합성곱을 표준 CNN 아키텍처에 효과적으로 적용하여 메모리 및 계산 비용을 줄일 수 있는가?
- RQ2초기 학습 시 저비용 합성곱을 사용하는 컴팩트한 학생 네트워크의 정확도를 지식 디스틸레이션을 통해 크게 향상시킬 수 있는가?
- RQ3온라인 디스틸레이션을 통해 사전 훈련된 교사나 다단계 훈련이 필요 없이 성능을 유지하거나 향상시킬 수 있는가?
- RQ4제안된 온라인 디스틸레이션 방법은 정확도, FLOPs, 파라미터 수 측면에서 최신 CNN 압축 기법과 비교해 어떻게 성능을 내는가?
주요 결과
- CIFAR-10에서 제안된 OD-Depthwise 방법은 ResNet-56 대비 FLOPs를 98.4% 감소시키고 파라미터를 90.5% 감소시켰으며, 상위 1위 오차는 6.46%를 유지했다.
- ImageNet에서 OD-Depthwise는 ResNet-50에서 상위 1위 오차 26.37%와 상위 5위 오차 7.34%를 기록하여 SSS-26(28.18%/9.21%)와 GAL-0.5(28.05%/9.06%)를 능가했으며, 1.79배의 압축을 달성했다.
- OD-Shift는 ResNet-18에서 5.66배의 속도 향상을 기록했으며(0.32B FLOPs 대비 SFP의 1.06B FLOPs), 정확도 저하가 있었지만 깊이 분할 또는 그룹 합성곱으로 전환함으로써 보완되었다.
- OD-Group-2는 ResNet-18에서 1.12B FLOPs로 상위 5위 오차 11.33%를 기록했으며, PFGM의 11.53% 오차(1.06B FLOPs)와 유사한 성능을 내어 효율-정확도 트레이드오프를 우수하게 구현했다.
- 상호 학습을 통해 MobileNet V2의 정확도가 향상되었으며, 이는 온라인 디스틸레이션 기법이 학생과 교사 양측의 성능을 향상시킨다는 것을 확인한다.
- 온라인 디스틸레이션 프레임워크는 평가된 모든 데이터셋 및 모델에서 최신 기술 수준의 성능을 달성했으며, 다양한 저비용 합성곱 유형에 대해 일관된 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.