Skip to main content
QUICK REVIEW

[논문 리뷰] Fully Learnable Group Convolution for Acceleration of Deep Neural Networks

Xijun Wang, Meina Kan|arXiv (Cornell University)|2019. 03. 31.
Advanced Neural Network Applications참고 문헌 44인용 수 4
한 줄 요약

이 논문은 종단간 훈련 중 최적의 채널 및 필터 그룹화를 자동으로 학습할 수 있는 새로운 그룹 컨벌루션 모듈인 완전 학습 가능한 그룹 컨벌루션(FLGC)을 제안한다. 이는 정확도를 희생시키지 않은 채 높은 가속도를 가능하게 하며, CPU에서 ResNet50 대비 최대 5배의 속도 향상을 달성한다. FLGC는 동적 그룹화 구조 학습과 임의의 그룹 수 지원을 통해 기존 표준 및 학습 가능한 그룹 컨벌루션 방법보다 정확도와 효율성 면에서 뛰어나다.

ABSTRACT

Benefitted from its great success on many tasks, deep learning is increasingly used on low-computational-cost devices, e.g. smartphone, embedded devices, etc. To reduce the high computational and memory cost, in this work, we propose a fully learnable group convolution module (FLGC for short) which is quite efficient and can be embedded into any deep neural networks for acceleration. Specifically, our proposed method automatically learns the group structure in the training stage in a fully end-to-end manner, leading to a better structure than the existing pre-defined, two-steps, or iterative strategies. Moreover, our method can be further combined with depthwise separable convolution, resulting in 5 times acceleration than the vanilla Resnet50 on single CPU. An additional advantage is that in our FLGC the number of groups can be set as any value, but not necessarily 2^k as in most existing methods, meaning better tradeoff between accuracy and speed. As evaluated in our experiments, our method achieves better performance than existing learnable group convolution and standard group convolution when using the same number of groups.

연구 동기 및 목표

  • 스마트폰 및 임베디드 시스템과 같은 자원 제약이 있는 장치에서 딥 네트워크의 높은 계산 비용과 메모리 소비 문제를 해결하기 위해.
  • 기존의 사전 정의된, 두 단계 또는 반복 전략에 의존하는 그룹 구조 선택 방법의 한계를 극복하기 위해.
  • 어떤 딥 네트워크 아키텍처에나 원활하게 통합될 수 있는 유연하고 종단간 훈련 가능한 그룹 컨벌루션 모듈을 개발하기 위해.
  • 정확도-속도 트레이드오프를 더 효과적으로 조정할 수 있도록, 2의 거듭제곱에 국한되지 않은 임의의 그룹 수를 지원하기 위해.
  • 동적 그룹화 구조 학습을 통해 정확도를 유지하거나 향상시키면서도 인퍼런스 속도를 크게 향상시키기 위해.

제안 방법

  • 종단간 백프로파게이션 과정에서 입력 채널과 컨벌루션 필터의 그룹화를 동시에 학습할 수 있는 완전 학습 가능한 그룹 컨벌루션(FLGC) 모듈을 제안한다.
  • 네트워크 손실을 기반으로 최적의 입력 채널 및 필터 할당을 자동으로 결정할 수 있도록 가능한 미분 가능한 그룹화 메커니즘을 도입한다.
  • 2^k에 국한되지 않는 임의의 그룹 수를 지원하여, 정확도와 인퍼런스 속도 사이의 더 유연하고 효과적인 트레이드오프를 가능하게 한다.
  • 딥라이크 세퍼러블 컨벌루션과 결합하여 인퍼런스 속도를 더욱 가속화하며, 단일 CPU에서 기존의 ResNet50 대비 최대 5배의 속도 향상을 달성한다.
  • 표준 잔차 블록 아키텍처를 사용하며, 1×1 컨벌루션 대신 FLGC를 통합하고, 120 에포크 동안 코즈인 학습률 스케줄을 사용해 모델을 훈련시킨다.
  • 공정한 비교를 위해 기준 모델들(예: CondenseNet)과 동일한 초모델 설정을 사용하며, 성능 향상이 FLGC 모듈 자체의 기여에서 기인함을 보장한다.

실험 결과

연구 질문

  • RQ1사전 정의되거나 반복 전략에 의존하지 않고 종단간 훈련을 통해 최적의 채널 및 필터 그룹화를 자동으로 학습할 수 있는 그룹 컨벌루션 모듈이 존재할 수 있는가?
  • RQ22의 거듭제곱에 국한되지 않는 임의의 그룹 수를 허용할 경우, 기존의 그룹 컨벌루션 방법보다 더 나은 정확도-속도 트레이드오프를 달성할 수 있는가?
  • RQ3딥라이크 세퍼러블 컨벌루션과 결합했을 때 FLGC는 정확도 저하 없이 CPU에서 더 큰 가속도를 달성할 수 있는가?
  • RQ4최신의 학습 가능한 그룹 컨벌루션(LGC, 예: CondenseNet 내의 LGC) 및 표준 그룹 컨벌루션과 비교해 FLGC는 정확도와 계산 효율성 면에서 어떻게 성능을 내는가?
  • RQ5FLGC는 다양한 네트워크 아키텍처(예: ResNet, MobileNetV2)에 쉽게 통합되어 성능을 유지하면서도 인퍼런스 속도를 가속화할 수 있는가?

주요 결과

  • FLGC는 44M FLOPs에서 ImageNet에서 6.77%의 top-1 오차를 기록하며, 동일한 아키텍처와 그룹 수 조건에서 표준 그룹 컨벌루션(29.0% 오차)과 LGC(26.2% 오차)를 모두 초월한다.
  • CIFAR-10에서 ResNet50-FLGC2는 44M FLOPs에서 6.77% 오차를 기록하며, ResNet56-pruned [25](90M FLOPs에서 6.94% 오차)와 ResNet56-pruned [14](62M FLOPs에서 8.2% 오차)를 모두 능가한다.
  • 8개 그룹을 사용한 MobileNetV2-FLGC는 76M FLOPs에서 6.91%의 top-1 오차를 기록하며, MobileNetV2-SGC(7.51% 오차)를 능가하고 NASNet-A와 같은 더 큰 모델의 성능에 가까이 다가선다.
  • 딥라이크 세퍼러블 컨벌루션과 결합했을 때 FLGC는 단일 CPU에서 기존의 ResNet50 대비 최대 5배의 인퍼런스 속도 향상을 달성한다.
  • G=2에서 G=8까지의 임의의 그룹 수를 지원하며, 그룹 수가 증가함에 따라 성능이 안정되거나 향상되어 강건성과 유연성을 입증한다.
  • FLGC는 표준 그룹 컨벌루션과 CondenseNet의 LGC보다 더 높은 정확도를 달성하면서도 유사하거나 낮은 FLOP 수를 유지하여, 그룹화 구조의 종단간 학습에서의 우수성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.