Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Residual Axial Networks

Nazmul Shahadat, Anthony S. Maida|arXiv (Cornell University)|2023. 01. 11.
Advanced Neural Network Applications인용 수 7
한 줄 요약

이 논문은 잔차 축 네트워크(Residual Axial Networks, RANs)를 제안한다. RANs는 2차원 합성곱을 고도 및 폭 축을 따라 순차적으로 적용되는 두 개의 1차원 깊이 분리형 합성곱으로 대체하고, 기울기 감소 문제를 완화하기 위해 잔차 연결을 통합한 새로운 CNN 아키텍처이다. RANs는 ResNets, MobileNets, SqueezeNexts와 비교해 75–86% 적은 파라미터와 67–80% 적은 FLOPs를 기록하면서도 CIFAR, SVHN, Tiny ImageNet 벤치마크에서 최소 1% 이상의 정확도 향상을 이룬다.

ABSTRACT

While convolutional neural networks (CNNs) demonstrate outstanding performance on computer vision tasks, their computational costs remain high. Several techniques are used to reduce these costs, like reducing channel count, and using separable and depthwise separable convolutions. This paper reduces computational costs by introducing a novel architecture, axial CNNs, which replaces spatial 2D convolution operations with two consecutive depthwise separable 1D operations. The axial CNNs are predicated on the assumption that the dataset supports approximately separable convolution operations with little or no loss of training accuracy. Deep axial separable CNNs still suffer from gradient problems when training deep networks. We modify the construction of axial separable CNNs with residual connections to improve the performance of deep axial architectures and introduce our final novel architecture namely residual axial networks (RANs). Extensive benchmark evaluation shows that RANs achieve at least 1% higher performance with about 77%, 86%, 75%, and 34% fewer parameters and about 75%, 80%, 67%, and 26% fewer flops than ResNets, wide ResNets, MobileNets, and SqueezeNexts on CIFAR benchmarks, SVHN, and Tiny ImageNet image classification datasets. Moreover, our proposed RANs improve deep recursive residual networks performance with 94% fewer parameters on the image super-resolution dataset.

연구 동기 및 목표

  • 자원 제약이 있는 환경에서 정확도를 유지하면서도 딥 CNN의 계산 비용을 줄이기 위해.
  • 학습 과정에서 기울기 소실 현상으로 인해 발생하는 깊은 축 방향 분리형 CNN의 성능 저하 문제를 해결하기 위해.
  • 기존 CNN 아키텍처의 표준 2차원 합성곱 레이어에 대한 파라미터 효율적이고 고성능 대체 기법을 개발하기 위해.
  • ResNets, MobileNets, SqueezeNext, 그리고 재귀 네트워크를 포함한 다양한 아키텍처에서 축 방향 1차원 깊이 분리형 합성곱의 효과를 평가하기 위해.
  • 제안된 RAN 블록이 이미지 분류 및 이미지 초해상도 복원과 같은 다양한 비전 작업에 일반화 가능함을 입증하기 위해.

제안 방법

  • 계산 비용을 줄이기 위해 표준 2차원 합성곱 연산을 고도 및 폭 축을 따라 순차적으로 적용되는 두 개의 1차원 깊이 분리형 합성곱으로 대체한다.
  • 깊은 네트워크에서 기울기 소실 문제를 완화하고 학습을 안정화하기 위해 축 방향 분리형 블록에 잔차 연결을 적용한다.
  • 표준 잔차 블록의 대체로 RAN 블록을 구성하여 기존 아키텍처인 ResNet, MobileNet, SqueezeNext 등에 즉시 통합할 수 있도록 한다.
  • 축 방향 1차원 합성곱을 사용해 공간적 특징을 한 번에 한 차원씩 순차적으로 처리함으로써 채널당 FLOP 수를 $k^2$에서 $2k$로 감소시킨다.
  • 넓은 ResNets, MobileNets, SqueezeNexts에 RAN 블록을 통합하여 RAN 기반 변종(예: WRANs, RAN-MobileNet, RAN-SqueezeNext)을 구축한다.
  • 이미지 초해상도 복원에 위해 재귀 아키텍처에 RAN 블록을 적용하여 파라미터 수를 줄이고 PSNR를 향상시키는 RARNet(Recursive Axial ResNet)을 개발한다.

실험 결과

연구 질문

  • RQ1축 방향 1차원 깊이 분리형 합성곱은 정확도를 유지하거나 향상시키면서도 CNN의 계산 비용을 줄일 수 있는가?
  • RQ2축 방향 분리형 블록에 잔차 연결을 추가함으로써 깊은 아키텍처에서의 학습 불안정성을 효과적으로 완화할 수 있는가?
  • RQ3RAN 기반 모델의 성능은 표준 대비 모델들(예: ResNet, MobileNet, SqueezeNext)과 비교해 파라미터 수, FLOPs, 지연 시간, 정확도 측면에서 어떻게 다를까?
  • RQ4RAN 블록은 이미지 초해상도와 같은 분류 외 작업에 효과적으로 적용될 수 있는가?
  • RQ5다양한 데이터셋과 네트워크 깊이에서 성능을 저하시키지 않고 RANs가 모델 크기와 추론 비용을 얼마나 줄일 수 있는가?

주요 결과

  • CIFAR-10, CIFAR-100, SVHN, Tiny ImageNet에서 RANs는 ResNets, 넓은 ResNets, MobileNets, SqueezeNexts보다 최소 1% 이상 높은 검증 정확도를 기록한다.
  • CIFAR 벤치마크에서 RANs는 ResNets, MobileNets, SqueezeNexts와 비교해 파라미터를 75–86% 감소시키고 FLOPs를 67–80% 감소시킨다.
  • 26층 아키텍처에서 RANs는 MobileNet 대비 파라미터를 75% 감소시키고 FLOPs를 67% 감소시키며 정확도를 1% 이상 향상시킨다.
  • RAN 기반 넓은 ResNets(WRANs)는 표준 넓은 ResNets(WRN) 대비 86% 적은 파라미터를 사용하면서 모든 넓이 인자에서 정확도가 향상된다.
  • Set5 이미지 초해상도 데이터셋에서 RARNet(RAN 기반 재귀 네트워크)은 DRRN 대비 학습 가능한 파라미터를 94% 감소시켰고 더 높은 PSNR 값을 기록했다.
  • RAN 기반 SqueezeNext 모델은 23층 아키텍처에서 원본 SqueezeNext 대비 파라미터를 34% 감소시키고, FLOPs를 24% 감소시키며 지연 시간을 33% 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.