Skip to main content
QUICK REVIEW

[논문 리뷰] HorNet: Efficient High-Order Spatial Interactions with Recursive Gated Convolutions

Yongming Rao, Wenliang Zhao|arXiv (Cornell University)|2022. 07. 28.
Advanced Neural Network Applications인용 수 185
한 줄 요약

HorNet은 재귀 게이트 컨볼루션(g^n Conv)을 도입하여 합성곱 기반 프레임워크에서 고차원 입력 적응형 공간 상호작용을 구현하고, HorFPN을 통해 밀도 예측을 강화하며, ImageNet, COCO, ADE20K 전반에서 vision Transformers 및 CNN과 경쟁력 있는 또는 우수한 성능을 보인다.

ABSTRACT

Recent progress in vision Transformers exhibits great success in various tasks driven by the new spatial modeling mechanism based on dot-product self-attention. In this paper, we show that the key ingredients behind the vision Transformers, namely input-adaptive, long-range and high-order spatial interactions, can also be efficiently implemented with a convolution-based framework. We present the Recursive Gated Convolution ($ extit{g}^ extit{n}$Conv) that performs high-order spatial interactions with gated convolutions and recursive designs. The new operation is highly flexible and customizable, which is compatible with various variants of convolution and extends the two-order interactions in self-attention to arbitrary orders without introducing significant extra computation. $ extit{g}^ extit{n}$Conv can serve as a plug-and-play module to improve various vision Transformers and convolution-based models. Based on the operation, we construct a new family of generic vision backbones named HorNet. Extensive experiments on ImageNet classification, COCO object detection and ADE20K semantic segmentation show HorNet outperform Swin Transformers and ConvNeXt by a significant margin with similar overall architecture and training configurations. HorNet also shows favorable scalability to more training data and larger model sizes. Apart from the effectiveness in visual encoders, we also show $ extit{g}^ extit{n}$Conv can be applied to task-specific decoders and consistently improve dense prediction performance with less computation. Our results demonstrate that $ extit{g}^ extit{n}$Conv can be a new basic module for visual modeling that effectively combines the merits of both vision Transformers and CNNs. Code is available at https://github.com/raoyongming/HorNet

연구 동기 및 목표

  • 비전 모델에서 표준 합성곱과 자기 주의 외에 고차원 공간 상호작용의 연구를 자극한다.
  • 계산량이 한정된 상태에서 임의의 차수의 공간 상호작용을 구현하기 위한 합성곱 메커니즘(g^n Conv)을 제안한다.
  • self-attention을 g^n Conv로 대체하여 HorNet 백본을 구축하고 분류, 탐지 및 분할 과제에서 검증한다.

제안 방법

  • 입력-적응적 공간 혼합을 가능하게 하는 게이트 컨볼루션(g Conv)을 도입한다.
  • 거친-정밀 채널 할당과 단일 깊이별 합성곱 경로를 통해 n차 공간 상호작용을 달성하기 위해 Recursive Gated Convolution (g^n Conv)을 개발한다(식 3.3–3.5).
  • 제한된 FLOPs 분석을 제공하여 FLOPs(g^n Conv) < HWC(2K^2 + 11/3 C + 2)임을 보인다.
  • 7×7 커널 또는 Global Filter (GF) 계층을 통해 장거리 상호작용을 지원하여 큰 수용 영역을 가능하게 한다.
  • self-attention 블록을 g^n Conv로 대체하여 HorNet 백본을 구성하고 밀도 예측 과제에서 특징 융합을 위한 HorFPN 변형을 구축한다.

실험 결과

연구 질문

  • RQ1g^n Conv가 계산 비용에 한계가 있는 상태에서도 임의의 차수의 공간 상호작용을 실현할 수 있는가?
  • RQ2동등한 아키텍처 및 학습 설정에서 HorNet 백본은 Swin Transformer 및 ConvNeXt를 능가하는가?
  • RQ3HorFPN 변형이 더 낮은 FLOPs로 밀도 예측 과제(의미론적 분할 및 객체 탐지)를 개선하는가?
  • RQ4더 큰 데이터 및 모델 크기(ImageNet-22K 사전학습)에서 g^n Conv 접근법이 확장 가능한가?

주요 결과

  • HorNet 변형은 유사 구성에서 ImageNet 분류, COCO 객체 탐지, ADE20K 분할에서 Swin Transformer 및 ConvNeXt를 일관되게 능가한다.
  • ImageNet-22K 사전학습으로 HorNet-L은 ImageNet에서 87.7% top-1 정확도, ADE20K val에서 57.9% mIoU, COCO val에서 59.2% 박스 AP를 달성한다.
  • 표준 3×3 합성곱을 g^n Conv로 교체한 특성 융합용 HorFPN은 의미론적 분할 및 객체 탐지에서 FLOPs를 크게 줄이면서 성능을 향상시킨다.
  • HorNet-L 7×7 및 HorNet-L GF는 의미론적 분할 벤치마크에서 ConvNeXt-XL을 능가하면서도 약 25% 정도 적은 FLOPs를 사용한다.
  • GF 변형은 여러 과제에서 일반적으로 7×7 변형보다 더 나은 성능을 달성하는 경향이 있어 글로벌 상호작용의 이점을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.