[논문 리뷰] Seesaw-Net: Convolution Neural Network With Uneven Group Convolution
Seesaw-Net는 채널 셔플링 연산에 의존하지 않고 표현 능력을 향상시키기 위해 비균형 그룹 컨볼루션과 두 가지 새로운 정보 흐름 패턴인 Seesaw-shuffle 및 Seesaw-share를 도입한다. 이는 경량화된 CNN에서 계산 비용을 최소화하면서도 ImageNet 및 CIFAR 벤치마크에서 최신 기준 성능을 달성하며, MobileNet-V2 및 IGCV3와 같은 모델들을 초월한다.
In this paper, we are interested in boosting the representation capability of convolution neural networks which utilizing the inverted residual structure. Based on the success of Inverted Residual structure[Sandler et al. 2018] and Interleaved Low-Rank Group Convolutions[Sun et al. 2018], we rethink this two pattern of neural network structure, rather than NAS(Neural architecture search) method[Zoph and Le 2017; Pham et al. 2018; Liu et al. 2018b], we introduce uneven point-wise group convolution, which provide a novel search space for designing basic blocks to obtain better trade-off between representation capability and computational cost. Meanwhile, we propose two novel information flow patterns that will enable cross-group information flow for multiple group convolution layers with and without any channel permute/shuffle operation. Dense experiments on image classification task show that our proposed model, named Seesaw-Net, achieves state-of-the-art(SOTA) performance with limited computation and memory cost. Our code will be open-source and available together with pre-trained models.
연구 동기 및 목표
- 계산 비용을 증가시키지 않으면서도 모바일 친화적인 CNN의 표현 능력을 향상시키기 위해.
- 기존의 균형 그룹 컨볼루션은 최소한의 계산 비용을 가지지만 항상 최적의 성능을 내지 못하는 한계를 해결하기 위해.
- 비균형 그룹 전략에 기반한 새로운 신경망 아키텍처 탐색 공간을 설계하기 위해.
- 비용이 많이 드는 채널 셔플링 연산에 의존하지 않고도 그룹 컨볼루션 레이어에서 효과적인 교차 그룹 정보 흐름을 가능하게 하기 위해.
- 자원이 제한된 모바일 및 엣지 디바이스에 적합한 메모리 및 계산 효율성이 뛰어난 아키텍처를 개발하기 위해.
제안 방법
- 입력 및 출력 채널을 균일하지 않은 그룹 크기(예: 1:2 비율)로 나누는 비균형 풀 컨볼루션을 도입하여 희박하고 구조화된 그룹 패턴을 생성한다.
- 이웃한 비균형 그룹 간의 구조적 순열 메커니즘을 통해 교차 그룹 정보 흐름을 가능하게 하는 Seesaw-shuffle 블록을 제안한다.
- 이웃한 비균형 그룹 컨볼루션 간의 직접적인 채널 공유를 통해 교차 그룹 흐름을 가능하게 하는 Seesaw-share 블록을 도입하여 채널 셔플링 연산이 필요 없도록 한다.
- 강력하고 효율적인 신경 빌딩 블록을 구성하기 위해 희박한 그룹 컨볼루션 커널을 활용한다.
- 기존의 표준 균형 그룹화와 고정된 커널 패턴을 초월하여 하이브리드 그룹 전략에 기반한 새로운 NAS 탐색 공간을 설계한다.
- 기존 프레임워크와의 호환성을 확보하고 추론 오버헤드를 줄이기 위해 표준 딥러닝 연산을 사용한다.
실험 결과
연구 질문
- RQ1기존의 균형 그룹 컨볼루션과 비교해 비균형 그룹 컨볼루션은 가벼운 CNN에서 표현 능력을 향상시킬 수 있는가?
- RQ2그룹 컨볼루션 레이어에서 채널 셔플링 연산 없이도 효과적인 교차 그룹 정보 흐름을 달성할 수 있는가?
- RQ3제안된 Seesaw 블록 설계는 MobileNet-V2 및 IGCV3와 같은 기존 모바일 아키텍처보다 더 나은 정확도-효율성 트레이드오프를 달성할 수 있는가?
- RQ4Seesaw-Net 아키텍처는 엄격한 FLOPs 및 파라미터 제약 조건 하에서 다양한 데이터셋과 모델 스케일에서 어떻게 성능을 발휘하는가?
- RQ5제안된 방법은 역전형 잔여 구조를 초월한 다른 신경 블록 설계로 일반화될 수 있는가?
주요 결과
- 0.5× 깊이 다중화를 사용한 Seesaw-Net은 CIFAR-10에서 95.09%의 상위-1 정확도를 기록하여, 유사한 FLOPs 조건에서 채널 셔플링을 사용한 IGCV3(0.5D)의 94.83% 및 Seesaw-shareNet(v1)의 94.56%를 초월한다.
- 채널 셔플링을 사용하지 않는 Seesaw-shareNet 버전은 CIFAR-10에서 94.56%의 상위-1 정확도를 달성하여, 고비용의 셔플링 연산 없이도 교차 그룹 흐름을 효과적으로 달성할 수 있음을 입증한다.
- CIFAR-100에서 Seesaw-shareNet(v1 0.5D)는 76.14%의 상위-1 정확도를 기록하여, 단지 4M 파라미터와 4M FLOP 증가로 인해 IGCV3(0.5D)의 75.75%를 초월한다.
- 제한된 계산 및 메모리 비용으로도 ImageNet에서 최고 성능을 달성하여 효율성과 확장성의 타당성을 입증한다.
- 고정된 FLOP 및 채널 제약 조건 하에서 비균형 그룹 컨볼루션은 균형 그룹 컨볼루션보다 더 뛰어난 표현 능력을 제공하며, 균형 그룹화가 최적이라는 가정에 도전한다.
- 제안된 Seesaw 블록은 그룹 간 효과적인 정보 흐름을 가능하게 하여 일반적으로 희박한 그룹화 전략과 관련된 성능 저하를 감소시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.