Skip to main content
QUICK REVIEW

[논문 리뷰] ANTNets: Mobile Convolutional Neural Networks for Resource Efficient Image Classification

Yunyang Xiong, Hyunwoo J. Kim|arXiv (Cornell University)|2019. 04. 07.
Advanced Neural Network Applications참고 문헌 25인용 수 18
한 줄 요약

ANTNet은 효율적인 채널별 어텐션과 그룹화된 컨벌루션을 사용하여 깊이 분리형 및 투영 레이어 간의 채널 상호의존성을 모델링하는 새로운 이동기기 친화적인 컨벌루션 신경망 블록인 ANTBlock을 제안한다. 이는 표현 능력을 향상시키면서도 계산 비용을 증가시키지 않는다. 이 방법은 이동기기에서 상태최저 수준의 정확도를 달성하며, iPhone 5s에서 157.7ms의 지연 시간으로 MobileNetV2보다 0.8% 높은 정확도를 기록하며 20% 더 빠른 추론 속도를 확보한다.

ABSTRACT

Deep convolutional neural networks have achieved remarkable success in computer vision. However, deep neural networks require large computing resources to achieve high performance. Although depthwise separable convolution can be an efficient module to approximate a standard convolution, it often leads to reduced representational power of networks. In this paper, under budget constraints such as computational cost (MAdds) and the parameter count, we propose a novel basic architectural block, ANTBlock. It boosts the representational power by modeling, in a high dimensional space, interdependency of channels between a depthwise convolution layer and a projection layer in the ANTBlocks. Our experiments show that ANTNet built by a sequence of ANTBlocks, consistently outperforms state-of-the-art low-cost mobile convolutional neural networks across multiple datasets. On CIFAR100, our model achieves 75.7% top-1 accuracy, which is 1.5% higher than MobileNetV2 with 8.3% fewer parameters and 19.6% less computational cost. On ImageNet, our model achieves 72.8% top-1 accuracy, which is 0.8% improvement, with 157.7ms (20% faster) on iPhone 5s over MobileNetV2.

연구 동기 및 목표

  • 엄격한 계산 및 파라미터 제약 조건 하에서 이동기기 배포에 적합한 경량이며 자원 효율적인 CNN 블록을 설계하기 위해.
  • 계산 비용을 증가시키지 않으면서도 깊이 분리형 컨벌루션의 표현 능력을 향상시키기 위해.
  • 깊이 분리형 및 투영 레이어 간의 채널 상호의존성을 효율적인 어텐션 메커니즘을 사용해 모델링하기 위해.
  • 기존의 이동기기 네트워크인 MobileNetV2 및 NASNet-A보다 실제 이동기기 하드웨어에서 더 빠른 추론 속도와 더 높은 정확도를 달성하기 위해.
  • 소요 비용이 거의 없는 추가적인 오버헤드로 성능을 향상시킬 수 있는 플러그 앤 플레이 형식이며 프레임워크 호환성 있는 블록을 제공하기 위해.

제안 방법

  • 깊이 분리형 컨벌루션, 그룹화된 포인트와이즈 컨벌루션, 그리고 새로운 채널별 어텐션 메커니즘을 조합한 새로운 기본 아키텍처 유닛인 ANTBlock을 제안한다.
  • 깊이 분리형 및 투영 레이어의 특징 간 상호의존성을 고차원 공간에서 모델링하는 동적 채널 재가중 메커니즘을 도입한다.
  • 파라미터 수와 계산 비용을 줄이면서도 표현 능력을 유지하기 위해 그룹화된 컨벌루션을 사용한다.
  • 두 단계의 어텐션 메커니즘을 활용한다: 전역 평균 풀링 후 완전 연결층을 통해 채널 가중치를 계산하여 선택적 특징 재가중을 가능하게 한다.
  • 기존 딥러닝 프레임워크와의 호환성을 고려해 설계하여 이동 네트워크 아키텍처에 쉽게 통합할 수 있도록 한다.
  • 채널 수용장과 전체 채널 정보 흐름을 유지하기 위해 블록 구성 설정을 최적화한다.

실험 결과

연구 질문

  • RQ1채널별 어텐션을 깊이 분리형 컨벌루션에 효과적으로 적용하여 계산 비용을 증가시키지 않으면서도 표현 능력을 향상시킬 수 있는가?
  • RQ2이동기기 친화적인 아키텍처에서 깊이 분리형 및 포인트와이즈 컨벌루션 특징 간의 상호의존성을 효율적으로 모델링할 수 있는가?
  • RQ3그룹화된 컨벌루션을 어텐션 메커니즘과 조합하여 파라미터 수와 FLOPs를 줄이면서도 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ4제안된 ANTBlock은 최신 경량 모델보다 실제 이동기기 하드웨어에서 더 빠른 추론 속도와 더 높은 정확도를 달성하는가?
  • RQ5ANTBlock은 엄격한 MAdds 및 파라미터 제약 조건 하에서 효율적이고 고성능의 이동기기 네트워크를 구축하는 데 일반화될 수 있는가?

주요 결과

  • CIFAR-100에서 ANTNet은 75.7%의 top-1 정확도를 기록하여 MobileNetV2보다 1.5% 높고, 파라미터 수는 8.3% 적고, 계산 비용은 19.6% 낮다.
  • ImageNet에서 ANTNet은 72.8%의 top-1 정확도를 기록하여 MobileNetV2보다 0.8% 높으며, iPhone 5s에서 157.7ms의 추론 지연 시간을 기록하여 MobileNetV2보다 20% 더 빠르다.
  • 깊이 배율 α=1.4를 사용한 ANTNet은 75.0%의 top-1 정확도를 기록하여 MobileNetV2보다 0.3% 높고, NASNet-A보다 1%, DARTS보다 2% 높다.
  • g=2 그룹을 사용한 모델은 267M MAdds와 13.4MB의 CoreML 크기를 기록하여 MobileNetV2보다 FLOPs와 모델 크기를 모두 줄였다.
  • iPhone 5s에서의 추론 속도는 MobileNetV2보다 20% 더 빠르며, 데스크톱 CPU에서도 일관되게 8-10%의 속도 향상이 관찰되었다.
  • ANTBlock 설계는 간단하게 구현 가능하며 주요 딥러닝 프레임워크와 호환되어 이동기기에서 쉽게 배포할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.