Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Group Convolution for Accelerating Convolutional Neural Networks

Zhuo Su, Linpu Fang|arXiv (Cornell University)|2020. 07. 08.
Advanced Neural Network Applications참고 문헌 61인용 수 4
한 줄 요약

이 논문은 입력에 따라 각 그룹의 입력 채널을 적응적으로 선택하는 동적 그룹 컨볼루션(Dynamic Group Convolution, DGC)을 제안한다. 이는 가벼운 선택기(lightweight selectors)를 사용하여 입력에 의존하는 특징 중요도를 기반으로 한다. DGC는 전체 네트워크 구조와 계산 효율성을 유지하면서도, 동적이고 샘플별 채널 연결성을 가능하게 하여 CIFAR-10, CIFAR-100, ImageNet 벤치마크에서 최신 기준 성능을 달성한다.

ABSTRACT

Replacing normal convolutions with group convolutions can significantly increase the computational efficiency of modern deep convolutional networks, which has been widely adopted in compact network architecture designs. However, existing group convolutions undermine the original network structures by cutting off some connections permanently resulting in significant accuracy degradation. In this paper, we propose dynamic group convolution (DGC) that adaptively selects which part of input channels to be connected within each group for individual samples on the fly. Specifically, we equip each group with a small feature selector to automatically select the most important input channels conditioned on the input images. Multiple groups can adaptively capture abundant and complementary visual/semantic features for each input image. The DGC preserves the original network structure and has similar computational efficiency as the conventional group convolution simultaneously. Extensive experiments on multiple image classification benchmarks including CIFAR-10, CIFAR-100 and ImageNet demonstrate its superiority over the existing group convolution techniques and dynamic execution methods. The code is available at https://github.com/zhuogege1943/dgc.

연구 동기 및 목표

  • 기본 및 학습 가능한 그룹 컨볼루션에서 고정된 희박 연결로 인한 정확도 저하 문제를 해결하기 위해.
  • 특징 표현 능력을 유지하기 위해 그룹 내에서 동적이고 입력에 의존하는 채널 선택을 가능하게 하기 위해.
  • 표준 그룹 컨볼루션과 유사한 계산 효율성을 유지하면서 모델 정확도를 향상시키기 위해.
  • ResNet, MobileNetV2, CondenseNet과 같은 기존 CNN 아키텍처와 호환되는 플러그 앤 플레이 모듈을 설계하기 위해.
  • 전역(global) 및 헤드별(head-wise) 임계값 전략의 차이가 프루닝 비율과 성능 트레이드오프에 미치는 영향을 탐색하기 위해.

제안 방법

  • 각 그룹에 대해 작은 학습 가능한 특징 선택기를 도입하여 입력 특징 맵에 기반해 어떤 입력 채널을 활성화할지 동적으로 결정한다.
  • 다양형 게이팅 메커니즘을 사용하여 채널 중요도 점수를 계산함으로써 엔드 투 엔드 학습이 가능하도록 한다.
  • 각 헤드별 또는 전역 임계값 전략을 적용하여 관련성이 낮은 입력 채널을 프루닝하고, 적응 가능한 희박 연결을 형성한다.
  • 작은 배치의 활성화 통계를 사용하여 매 3 에포크마다 임계값을 동적으로 갱신하기 위해 사전성 라이브러리 접근법을 활용한다.
  • 헤드 간에 수직인 사전성 벡터를 장려하기 위해 각도 확대 손실(angle enlargement loss)를 통합한다. 이는 특징 다양성을 증진시킨다.
  • 헤드별 및 전역 임계값 전략을 모두 지원하며, 후자는 층별로 프루닝 비율을 조절할 수 있어 성능 향상을 이룰 수 있지만, 구조적 비정규성 증가를 수반한다.

실험 결과

연구 질문

  • RQ1그룹 내에서 동적이고 입력에 적응하는 채널 선택이 계산 효율성을 희생시키지 않고 정확도 향상에 기여할 수 있는가?
  • RQ2정적 그룹 컨볼루션과 다른 동적 실행 방법에 비해 DGC는 정확도와 속도 측면에서 어떻게 비교되는가?
  • RQ3전역 임계값과 헤드별 임계값 전략의 차이가 프루닝 비율과 모델 성능에 어떤 영향을 미치는가?
  • RQ4DGC는 ResNet 및 CondenseNet과 같은 기존 CNN 아키텍처에 아키텍처 수정 없이 효과적으로 통합될 수 있는가?
  • RQ5헤드 간에 수직인 사전성 벡터를 장려하면 특징 표현과 일반화 능력이 향상되는가?

주요 결과

  • DGC는 CondenseNet-86-DGC-G 아키텍처를 사용하여 ImageNet에서 Top-1 오차 4.42%를 달성하였으며, 원본 CondenseNet-86(5.00%) 및 기타 최신 필터 수준 프루닝 방법을 초월한다.
  • CIFAR-100에서 DGC는 71M MACs로 오차를 23.36%까지 낮추었으며, 원본 CondenseNet-86(23.64%) 및 기타 프루닝 모델을 능가한다.
  • 추론 중 실제 프루닝 비율이 목표 비율 ξ와 매우 유사하게 유지되어, 효과적이고 안정적인 임계값 적응이 이루어지고 있음을 시사한다.
  • 전역 임계값 전략이 헤드별 전략보다 略적으로 더 높은 정확도(이미지넷에서 Top-1 오차 25.2% 대 25.8%)를 기록하지만, 구조적 비정규성이 증가한다.
  • 각도 확대 손실은 전역 임계값 전략을 사용할 경우에만 약간의 성능 향상을 제공하며, 이는 수직성이 주로 헤드별 학습을 통해 달성된다는 것을 시사한다.
  • DGC는 보조 선택기의 추가로 인한 오버헤드가 미미하여 표준 그룹 컨볼루션과 유사한 계산 효율성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.