Skip to main content
QUICK REVIEW

[논문 리뷰] Accelerating Large-Kernel Convolution Using Summed-Area Tables

Linguang Zhang, Maciej Halber|arXiv (Cornell University)|2019. 06. 26.
Human Pose and Action Recognition참고 문헌 33인용 수 7
한 줄 요약

이 논문은 합산 영역 표(SATs)와 학습 가능한 박스 필터를 사용하여 기저 수치가 적고, 기울기 연산이 가능한 대규모 커널 컨볼루션 레이어를 제안한다. 이는 고해상도 특징 맵을 유지하면서 추론 속도를 높인다. SATs를 활용해 일정 시간 내 임의의 직사각형 영역의 합을 계산하고, 필터를 위치와 크기의 네 개 변수로 매개변수화함으로써 계산량을 제곱 수준으로 줄이고 파라미터 수도 감소시킨다. 이로 인해 인간 자세 추정 작업에서 185만 개의 파라미터로 경쟁 가능한 성능을 달성했으며, 이는 이전 방법들보다 수개의 주기 수준으로 줄어든 것이다. 또한 제한된 데이터에서 더 우수한 일반화 성능을 보였다.

ABSTRACT

Expanding the receptive field to capture large-scale context is key to obtaining good performance in dense prediction tasks, such as human pose estimation. While many state-of-the-art fully-convolutional architectures enlarge the receptive field by reducing resolution using strided convolution or pooling layers, the most straightforward strategy is adopting large filters. This, however, is costly because of the quadratic increase in the number of parameters and multiply-add operations. In this work, we explore using learnable box filters to allow for convolution with arbitrarily large kernel size, while keeping the number of parameters per filter constant. In addition, we use precomputed summed-area tables to make the computational cost of convolution independent of the filter size. We adapt and incorporate the box filter as a differentiable module in a fully-convolutional neural network, and demonstrate its competitive performance on popular benchmarks for the task of human pose estimation.

연구 동기 및 목표

  • 완전 컨volution 네트워크에서 대규모 커널 컨볼루션의 계산 및 파라미터 비효율성을 해결하기 위해.
  • 다운샘플링 없이 고해상도 출력을 가능하게 하여 공간적 세부 정보를 유지하기 위해.
  • 합산 영역 표와 박스 필터를 사용해 기울기 연산이 가능한, 종단 간(end-to-end) 학습이 가능한 모듈을 설계하기 위해.
  • 모델 복잡도를 줄임으로써 데이터 부족 상황에서의 일반화 성능 향상을 위해.

제안 방법

  • 모든 직사각형 영역의 합을 일정 시간 내에 계산할 수 있도록 합산 영역 표(SATs)를 활용하여 대규모 커널 컨볼루션을 O(1)로 수행한다.
  • 위치(x, y)와 너비, 높이의 네 개 변수로 매개변수화된 학습 가능한 박스 필터를 사용하여, 필터의 크기와 관계없이 파라미터 수를 일정하게 유지한다.
  • 박자 위치(sub-pixel positioning)를 도입하여 박스 모서리의 기울기 연속성을 확보함으로써, 백프로파게이션 동안 기울기 연산이 가능하게 하여 종단 간 학습을 가능하게 한다.
  • 다중 박스 필터링 특징 맵을 조합하기 위해 깊이 분리 컨볼루션과 1×1 컨볼루션을 차용하여 복잡한 커널을 근사한다.
  • 완전 컨볼루션 네트워크 내에서 SAT 기반 컨볼루션을 기울기 연산 가능한 레이어로 적용하여, 표준 대규모 커널 대신 효율적인 박스 필터 등가물로 교체한다.
  • 수렴 후 정수 좌표 샘플링을 적용하여 추론 시 보간을 제거함으로써 FLOPs를 감소시킨다.

실험 결과

연구 질문

  • RQ1합산 영역 표는 딥러닝에 효과적으로 통합되어 대규모 커널 컨볼루션을 최소한의 파라미터 오버헤드로 가속화할 수 있는가?
  • RQ2각 필터당 단지 네 개의 파라미터를 가지는 학습 가능한 박스 필터가 단순함에도 불구하고 밀집 예측 작업에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ3학습 데이터가 제한된 상황에서 제안된 방법이 표준 대규모 커널 또는 확장 컨볼루션 네트워크보다 더 우수한 일반화 성능을 보일 수 있는가?
  • RQ4박스 필터의 파라미터(위치 및 크기)의 기울기 연산이 서브픽셀 위치 기반 기법을 통해 백프로파게이션 동안 유지될 수 있는가?

주요 결과

  • 제안된 방법은 MPII 인간 자세 추정 데이터셋에서 경쟁 가능한 성능을 달성하였으며, 처음부터 학습한 SimpleBaseline(ResNet50)를 능가하고, 약 1000만 개의 파라미터를 사용하는 CPN과 유사한 성능를 보였다. 파라미터 수는 185만 개로 훨씬 적었다.
  • COCO test-dev2017 세트에서 제안된 방법은 경쟁 가능한 결과를 내며, 다양한 자세와 스케일에 걸쳐 강력한 일반화 성능을 입증했다.
  • 제한된 데이터에서 모델의 일반화 성능이 뛰어나, MPII 데이터셋의 10%만으로도 학습을 완료한 후 SimpleBaseline보다 더 높은 검증 정확도를 유지했다.
  • 학습 과정에서 학습된 박스 필터는 다양하고 비대칭적인 형태로 진화하여 이전 연구에서 관찰된 대칭성 편향을 피했다.
  • 수렴 후 박스 모서리 좌표를 정수로 반올림하면 보간이 제거되어 계산 비용이 감소하고, 성능 저하도 최소한도로 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.