Skip to main content
QUICK REVIEW

[논문 리뷰] Drop an Octave: Reducing Spatial Redundancy in Convolutional Neural Networks with Octave Convolution

Yunpeng Chen, Haoqi Fan|arXiv (Cornell University)|2019. 04. 10.
Advanced Neural Network Applications참고 문헌 50인용 수 149
한 줄 요약

본 논문은 이미지 특징 맵을 고주파/저주파 옥타브로 분해하는 플러그-앤-플레이 연산인 Octave Convolution (OctConv)을 도입하여 공간적 중복을 줄이고 메모리/계산량을 감소시키면서 이미지 및 비디오 작업에서 정확도를 향상시킨다.

ABSTRACT

In natural images, information is conveyed at different frequencies where higher frequencies are usually encoded with fine details and lower frequencies are usually encoded with global structures. Similarly, the output feature maps of a convolution layer can also be seen as a mixture of information at different frequencies. In this work, we propose to factorize the mixed feature maps by their frequencies, and design a novel Octave Convolution (OctConv) operation to store and process feature maps that vary spatially "slower" at a lower spatial resolution reducing both memory and computation cost. Unlike existing multi-scale methods, OctConv is formulated as a single, generic, plug-and-play convolutional unit that can be used as a direct replacement of (vanilla) convolutions without any adjustments in the network architecture. It is also orthogonal and complementary to methods that suggest better topologies or reduce channel-wise redundancy like group or depth-wise convolutions. We experimentally show that by simply replacing convolutions with OctConv, we can consistently boost accuracy for both image and video recognition tasks, while reducing memory and computational cost. An OctConv-equipped ResNet-152 can achieve 82.9% top-1 classification accuracy on ImageNet with merely 22.2 GFLOPs.

연구 동기 및 목표

  • 자연 이미지가 여러 공간 주파수에서 정보를 포함하고 있어 별도 처리가 필요하다는 것을 동기화하고 모델링한다.
  • 아키텍처 변경 없이 바닐라 컨볼루션을 대체하는 일반적이고 플러그-앤-플레이 Octave Convolution 유닛을 제안한다.
  • OctConv가 ImageNet과 Kinetics에서 2D 및 3D 백본에 대해 메모리와 FLOPs를 줄이면서 정확도를 높임을 보인다.
  • 그룹 및 깊이별(깊이 축소) 컨볼루션과의 호환성을 Demonstrate하고 수용 필드의 이점과 정렬 고려사항을 분석한다.

제안 방법

  • 입력 채널을 고주파 XH 과 저주파 XL 그룹으로 나누고 XL은 공간 해상도가 절반인 하나의 옥타브로 정의하여 옥타브 특징 표현을 정의한다.
  • 커널을 주파수 내 구성요소와 주파수 간 구성요소로 분해하여 YH와 YL을 네 개의 계산 경로로 업데이트하는 Octave Convolution을 고안한다.
  • YH = f(XH; WHH) + upsample(f(XL; LHH), 2) and YL = f(XL; LLL) + pool(f(XH; HLH), 2), inter-frequency 정보 교환을 가능하게 한다.
  • 정렬 오류를 피하고 효율성을 유지하기 위해 다운샘플링에 평균 풀링을 사용하여 실용적인 세부 구현을 제시한다.
  • OctConv를 기존 아키텍처에 대폭 설계 변경 없이 통합하기 위한 그룹 및 깊이별 컨볼루션용 변형을 제공한다.

실험 결과

연구 질문

  • RQ1바닐라 컨볼루션을 OctConv로 대체하면 이미지 및 비디오 인식 작업에서 정확도가 향상되는가?
  • RQ2다양한 백본 아키텍처에서 OctConv를 사용할 때 FLOPs/메모리 트레이드오프는 어떻게 되는가?
  • RQ3저주파 채널 비율 α가 성능과 효율성에 어떤 영향을 미치는가?
  • RQ4OctConv가 그룹 및 깊이별 컨볼루션 및 기타 효율 지향 CNN 설계와 호환되는가?
  • RQ5OctConv가 수용 필드 및 주파수 그룹 간 정보 교환에 어떤 영향을 미치는가?

주요 결과

  • OctConv이 적용된 네트워크는 ImageNet 및 Kinetics의 여러 백본에서 정확도를 지속적으로 향상시키고 FLOPs를 감소시킨다.
  • OctConv와 함께 하는 FLOPs-정확도 트레이드오프는 오목곡선을 이루며 α = 0.125~0.25 근처의 스위트 스폿에서 상당한 이점을 제공한다.
  • OctConv는 이론적 FLOP 감소에 근접한 실용적 속도 향상을 제공하며, 예를 들어 ResNet-50은 CPU에서 주목할 만한 속도 향상을 보인다.
  • 저주파 맵은 효과적 수용 필드를 두 배로 확장하여 추가 메모리 없이도 더 나은 맥락 이해를 가능하게 한다.
  • 주파수 그룹 간의 intra- 및 inter- 교환 경로 모두가 성능 극대화에 중요하며, 얕은 네트워크에서 수용 필드 이득이 커지므로 OctConv의 이점이 더 크게 나타난다.
  • MG-Conv 및 관련 다중 스케일 방법과 비교할 때 OctConv는 더 낮은 메모리 및 계산으로 FLOPs-정확도 측면에서 더 좋다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.