Skip to main content
QUICK REVIEW

[논문 리뷰] Structured Convolutions for Efficient Neural Network Design

Yash Bhalgat, Yizhe Zhang|arXiv (Cornell University)|2020. 08. 06.
Advanced Neural Network Applications참고 문헌 47인용 수 8
한 줄 요약

이 논문은 표준 합성곱 커널을 합성 풀링 연산과 더 작은, 저복잡도의 합성곱으로 분해함으로써 모델 압축을 크게 가능하게 하는 Structured Convolutions를 제안한다. 구조적 정규화 손실을 도입함으로써 표준 네트워크가 이러한 효율적인 구조를 학습하도록 유도함으로써, 정확도 저하를 최소화하면서 최대 2배 작아진 ResNet과 50% 작아진 HRNet을 달성하였으며, 기존의 텐서 분해 및 프루닝 방법들보다 효율성이 뛰어나다.

ABSTRACT

In this work, we tackle model efficiency by exploiting redundancy in the extit{implicit structure} of the building blocks of convolutional neural networks. We start our analysis by introducing a general definition of Composite Kernel structures that enable the execution of convolution operations in the form of efficient, scaled, sum-pooling components. As its special case, we propose extit{Structured Convolutions} and show that these allow decomposition of the convolution operation into a sum-pooling operation followed by a convolution with significantly lower complexity and fewer weights. We show how this decomposition can be applied to 2D and 3D kernels as well as the fully-connected layers. Furthermore, we present a Structural Regularization loss that promotes neural network layers to leverage on this desired structure in a way that, after training, they can be decomposed with negligible performance loss. By applying our method to a wide range of CNN architectures, we demonstrate "structured" versions of the ResNets that are up to 2$ imes$ smaller and a new Structured-MobileNetV2 that is more efficient while staying within an accuracy loss of 1% on ImageNet and CIFAR-10 datasets. We also show similar structured versions of EfficientNet on ImageNet and HRNet architecture for semantic segmentation on the Cityscapes dataset. Our method performs equally well or superior in terms of the complexity reduction in comparison to the existing tensor decomposition and channel pruning methods.

연구 동기 및 목표

  • 자원 제약이 있는 장치에 깊은 신경망을 구현하는 데 도전하는 문제를 해결하기 위해, 합성곱 커널 내 임베디드된 구조적 부족성(implicit structural redundancy)을 활용한다.
  • 정확도 저하 없이 모델 복잡도와 파라미터 수를 감소시킨다.
  • 표준 합성곱 레이어가 효율적인 분해에 적합한 구조적 형태를 취하도록 유도하는 학습 방법을 개발한다.
  • 하드웨어 우수한 연산인 합성 풀링과 경량 합성곱을 활용해 효율적인 추론을 가능하게 한다.

제안 방법

  • 학습 가능한 스칼라를 가진 M개의 선형 독립적인 이진 마스크를 겹쳐서 합성곱 커널을 구성하는 일반적인 프레임워크인 복합 커널(Composite Kernel)을 도입한다.
  • 복합 커널의 특수한 경우로, 합성 풀링 레이어와 c × n × n 커널을 가진 더 작은 합성곱으로 분해되는 Structured Convolutions를 제안하며, C × N × N 대신 사용한다.
  • 가중치 행렬을 구조적 부분공간에 투영한 오차의 프로베니우스 노름을 최소화하는 구조적 정규화 손실을 설계하여, 학습 과정에서 원하는 커널 구조를 유도한다.
  • 2D 및 3D 합성곱 레이어뿐 아니라 완전 연결 레이어에도 적용하여 광범위한 아키텍처 호환성을 확보한다.
  • 이중 단계 프로세스를 활용: 먼저 전체 커널과 정규화를 함께 학습하고, 이후 추론 시 각 커널을 합성 풀링 + 작은 합성곱으로 교체한다.
  • 정규화 기반 학습 방법이 직접 분해된 아키텍처에서 학습하는 것보다 성능이 뛰어나며, 이는 점진적인 구조 제약 적용 덕분이다.

실험 결과

연구 질문

  • RQ1합성곱 커널 가중치 내 임베디드된 구조적 부족성을 활용하여 정확도 저하 없이 모델 복잡도를 감소시킬 수 있는가?
  • RQ2표준 합성곱 레이어를 어떻게 학습시켜, 합성 풀링과 경량 합성곱으로 효율적으로 분해할 수 있는 구조적 형태를 취하게 할 수 있는가?
  • RQ3직접 분해된 아키텍처에서 학습하는 것과 비교해 구조적 정규화가 모델 정확도와 효율성에 미치는 영향은 어떠한가?
  • RQ4ResNet, MobileNetV2, EfficientNet, HRNet와 같은 다양한 아키텍처에서 Structured Convolutions가 모델 크기와 FLOPs를 얼마나 줄일 수 있는가?
  • RQ5기존의 텐서 분해 및 채널 프루닝 기법들과 비교해 이 방법의 효율성과 정확도는 어떠한가?

주요 결과

  • ImageNet과 CIFAR-10에서 표준 ResNet보다 최대 2배 작아진 Structured ResNets는 정확도 손실가 거의 없이 성능을 유지한다.
  • ImageNet과 CIFAR-10에서 정확도 손실이 단 1%에 불과하지만, 제안된 Structured-MobileNetV2는 MobileNetV2보다 더 높은 효율성을 달성한다.
  • ImageNet에서의 EfficientNet 기반 구조적 버전은 모델 크기와 계산량을 감소시키며 정확도 저하가 최소한이다.
  • Cityscapes에서의 HRNet 기반 세그멘테이션 모델은 크기가 50% 감소하고 FLOPs는 30% 감소했으며, mIoU는 단지 1.5% 감소했다.
  • 큰 배치 크기 조건에서도 학습 시간과 메모리에 5% 미만의 오버헤드만 추가하므로, 실용적인 학습 방법이다.
  • 점진적인 구조 제약 학습 덕분에 정규화 기반 학습 방법이 직접 분해 아키텍처에서 학습하는 것보다 정확도에서 0.9%에서 1.5% 더 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.