[논문 리뷰] CGaP: Continuous Growth and Pruning for Efficient Deep Learning
CGaP는 초기에 작은 네트워크 시드에서 시작하여 중요 필터와 뉴런을 민감도 점수에 기반해 동적으로 확장하고, 이후 모델을 정제함으로써 높은 정확도를 달성하면서도 파라미터와 FLOPs를 크게 감소시키는 연속적인 성장 및 정제 프레임워크를 제안한다. CIFAR-100과 SVHN에서 CGaP는 VGG-19의 파라미터를 최대 85.8% 감소시키고 FLOPs를 74.2% 감소시켜 표준 정제 전용 방법들을 능가한다.
Today a canonical approach to reduce the computation cost of Deep Neural Networks (DNNs) is to pre-define an over-parameterized model before training to guarantee the learning capacity, and then prune unimportant learning units (filters and neurons) during training to improve model compactness. We argue it is unnecessary to introduce redundancy at the beginning of the training but then reduce redundancy for the ultimate inference model. In this paper, we propose a Continuous Growth and Pruning (CGaP) scheme to minimize the redundancy from the beginning. CGaP starts the training from a small network seed, then expands the model continuously by reinforcing important learning units, and finally prunes the network to obtain a compact and accurate model. As the growth phase favors important learning units, CGaP provides a clear learning purpose to the pruning phase. Experimental results on representative datasets and DNN architectures demonstrate that CGaP outperforms previous pruning-only approaches that deal with pre-defined structures. For VGG-19 on CIFAR-100 and SVHN datasets, CGaP reduces the number of parameters by 78.9% and 85.8%, FLOPs by 53.2% and 74.2%, respectively; For ResNet-110 On CIFAR-10, CGaP reduces 64.0% number of parameters and 63.3% FLOPs.
연구 동기 및 목표
- 사전에 정의된 과도하게 파rameter화된 모델의 비효율성, 즉 레이어의 중복성을 줄이기 위해 훈련 후 정제가 필요한 문제를 해결하기 위해.
- 큰 아키텍처가 아닌 최소한의 네트워크 시드에서 훈련을 시작함으로써 초기 중복성을 제거하기 위해.
- 정제 단계 이전의 성장 단계에서 중요한 단위를 강화함으로써 학습 효율성과 정제 정확도를 향상시키기 위해.
- 높은 정확도를 유지하면서 하드웨어에 효율적인 희소 모델을 생성하는 동적이고 구조적인 정제 방법을 개발하기 위해.
제안 방법
- CGaP는 표준 모델의 0.1%에서 3% 크기의 작은 네트워크 시드에서 훈련을 시작한다.
- 각 단위가 훈련 손실에 기여하는 정도를 측정하는 민감도 점수에 기반해, 새로운 필터와 뉴런을 추가함으로써 네트워크를 지속적으로 확장한다.
- 성장 단계에서는 중요한 학습 단위를 강화하여 이후 정제 단계에서 더 명확한 학습 목표를 제공한다.
- 정점 용량에 도달한 후, 구조적 필터 및 뉴런 정제를 적용하여 중요하지 않은 단위를 제거한다.
- 민감도 점수는 성장과 정제 결정에 모두 사용되어 중요한 구성 요소를 일관되게 식별한다.
- 성장률, 임계값, 성장 빈도와 같은 하이퍼파라미터는 모델 크기, 정확도, 수렴성 간의 균형을 맞추기 위해 히우리스틱적으로 조정된다.
실험 결과
연구 질문
- RQ1동적 네트워크 성장 및 정제 전략이 모델 효율성과 정확도 면에서 표준 정제 전용 파ipeline을 능가할 수 있는가?
- RQ2과도하게 파rameter화된 초기화 방식과 비교해 최소한의 시드에서 훈련을 시작함으로써 중복성과 과적합이 감소하는가?
- RQ3성장 단계에서 중요한 단위를 강화하면 최종 모델의 정확도와 정제 효과성이 어떻게 향상되는가?
- RQ4초기 시드 크기와 하이퍼파라미터의 변동에 대해 최종 모델이 어느 정도 강인한가?
- RQ5성장 단계가 정제 단계를 향상시키는 의미 있는 학습 신호로 기능할 수 있는가?
주요 결과
- CIFAR-100에서 CGaP는 VGG-19의 파라미터를 78.9% 감소시키고 FLOPs를 53.2% 감소시키며, 기준 모델 대비 정확도를 0.37% 향상시켰다.
- SVHN에서 CGaP는 VGG-19의 파라미터를 85.8% 감소시키고 FLOPs를 74.2% 감소시켰으며, 정확도는 0.23% 향상되었다.
- CIFAR-10에서 ResNet-110에 대해 CGaP는 파라미터를 64.0% 감소시키고 FLOPs를 63.3% 감소시켰으며, 정확도는 0.09% 향상되었다.
- 민감도 기반 성장은 정제 중 손실 급증을 랜덤 성장 대비 1.4배 감소시켜 더 높은 안정성을 보였다.
- 최종 모델의 구조는 상당히 희소적이고 구조적으로 구성되어 있어 비구조적 희소성보다 더 뛰어난 하드웨어 효율성을 제공한다.
- 모델은 시드 크기와 하이퍼파라미터의 변동에 대해 강인하며, 테스트된 설정 간 정확도 변동은 2% 이내였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.