Skip to main content
QUICK REVIEW

[논문 리뷰] Dilated convolution with learnable spacings

Ismail Khalfaoui-Hassani, Thomas Pellegrini|arXiv (Cornell University)|2021. 12. 07.
Advanced Neural Network Applications참고 문헌 46인용 수 18
한 줄 요약

이 논문은 확장된 컨벌루션에서 비제로 커널 요소의 위치를 보간을 통해 미분 가능하게 학습하는 방법인 학습 가능한 간격을 가진 확장 컨벌루션(DCLS)을 제안한다. 이는 파rameter 수를 늘리지 않고도 더 넓은 수신 필드를 가능하게 하며, 파라미터 수가 동일한 조건에서 ImageNet-1K 정확도와 다운스트림 작업 성능을 향상시킨다. DCLS는 표준 및 고정 간격 컨벌루션보다 우수한 성능을 보이며, 처리량에 거의 영향을 주지 않는다.

ABSTRACT

Recent works indicate that convolutional neural networks (CNN) need large receptive fields (RF) to compete with visual transformers and their attention mechanism. In CNNs, RFs can simply be enlarged by increasing the convolution kernel sizes. Yet the number of trainable parameters, which scales quadratically with the kernel's size in the 2D case, rapidly becomes prohibitive, and the training is notoriously difficult. This paper presents a new method to increase the RF size without increasing the number of parameters. The dilated convolution (DC) has already been proposed for the same purpose. DC can be seen as a convolution with a kernel that contains only a few non-zero elements placed on a regular grid. Here we present a new version of the DC in which the spacings between the non-zero elements, or equivalently their positions, are no longer fixed but learnable via backpropagation thanks to an interpolation technique. We call this method "Dilated Convolution with Learnable Spacings" (DCLS) and generalize it to the n-dimensional convolution case. However, our main focus here will be on the 2D case. We first tried our approach on ResNet50: we drop-in replaced the standard convolutions with DCLS ones, which increased the accuracy of ImageNet1k classification at iso-parameters, but at the expense of the throughput. Next, we used the recent ConvNeXt state-of-the-art convolutional architecture and drop-in replaced the depthwise convolutions with DCLS ones. This not only increased the accuracy of ImageNet1k classification but also of typical downstream and robustness tasks, again at iso-parameters but this time with negligible cost on throughput, as ConvNeXt uses separable convolutions. Conversely, classic DC led to poor performance with both ResNet50 and ConvNeXt. The code of the method is available at: https://github.com/K-H-Ismail/Dilated-Convolution-with-Learnable-Spacings-PyTorch.

연구 동기 및 목표

  • 표준 확장 컨벌루션에서 고정된 정규 격자 간격의 한계를 해결함으로써 수신 필드 최적화를 가능하게 하기 위해.
  • 이산적인 위치의 비가역성 문제를 해결하기 위해 확장 컨벌루션 내 비제로 커널 요소의 위치를 기울기 기반으로 학습할 수 있도록 하기 위해.
  • 모델 파라미터나 계산 비용을 증가시키지 않고 이미지 분류 및 내성성 테스크 성능을 향상시키기 위해.
  • 현대형 CNN(예: ConvNeXt)에 DCLS를 즉각적인 교체로 적용할 수 있는지 평가하기 위해, 특히 깊이 분리형 컨벌루션과의 호환성을 중심으로.
  • ImageNet-1k와 같은 대규모 시각 기준에서 DCLS의 확장성과 효능을 탐색하기 위해.

제안 방법

  • 이중 선형 보간을 사용하여 비제로 커널 요소의 이산적 위치를 미분 가능하게 하여, 엔드 투 엔드 역전파를 가능하게 한다.
  • 커널 위치를 연속적인 오프셋으로 매개변수화하여, 희소성을 유지하면서도 학습 중 최적화한다.
  • 1D, 2D, 3D 및 혼합 차원(예: 2-1D, 3-2D) 컨벌루션으로 일반화되며, 컴퓨터 비전 분야에 초점을 맞춘다.
  • 커널 가중치와 위치를 함께 최적화하며, 채널 및 공간 위치 간에 위치 공유를 통해 과적합을 줄인다.
  • 처리량 오버헤드를 최소화하기 위해 깊이 분리형 암시적 GEMM 등의 효율적 구현과 호환된다.
  • 입력 기반 메커니즘(예: 변형 가능 컨벌루션)을 피함으로써 입력 독립성과 안정성을 유지한다.

실험 결과

연구 질문

  • RQ1확장 컨벌루션 내 비제로 요소의 위치를 학습함으로써 수신 필드 효율성과 모델 정확도를 향상시킬 수 있는가?
  • RQ2동일한 파라미터 수에서 DCLS가 표준 및 고정 간격 컨벌루션보다 이미지 분류 및 다운스트림 작업에서 더 우수한 성능을 내는가?
  • RQ3DCLS는 처리량 저하 없이 현대형 CNN(예: ConvNeXt)에 즉각적인 교체로 효과적으로 적용될 수 있는가?
  • RQ4위치 공유와 보간이 DCLS의 학습 안정성과 성능에 어떤 영향을 미치는가?
  • RQ5DCLS는 ImageNet-1k와 같은 대규모 기준 및 내성성 기준에서 효과적인가?

주요 결과

  • DCLS는 깊이 분리형 컨벌루션을 대체함으로써 ConvNeXt에서 ImageNet-1K의 top-1 정확도를 향상시켰으며, 처리량에 거의 영향을 주지 않았다.
  • ResNet50에서는 DCLS가 동일한 파라미터 수에서 정확도를 높였지만, 처리량에 손해를 끼쳤다. 이는 ConvNeXt와는 다름.
  • 표준 확장 컨벌루션은 ResNet50와 ConvNeXt 양쪽에서 성능 향상을 이루지 못했으며, 이는 그 유연성 부족이 성능 제한 요인임을 시사한다.
  • DCLS는 변형 가능 컨벌루션 v2와 같은 입력 기반 방법보다 ConvNeXt에서 더 뛰어난 성능을 보였으며, 이는 학습 불안정성과 높은 지연을 야기했다.
  • DCLS는 다운스트림 및 내성성 테스크 전반에서 일관된 성능 향상을 보이며, 분류를 넘어서도 광범위하게 적용 가능함을 시사한다.
  • 스테이지 내 위치 공유가 DCLS의 안정적이고 효과적인 학습에 필수적이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.