[논문 리뷰] Glance and Focus: a Dynamic Approach to Reducing Spatial Redundancy in Image Classification
GFNet은 강화학습으로 안내되는 작은 이미지 패치를 순차적으로 처리( glance then focus )하여 공간 중복성을 감소시키고, 계산량은 줄인 채 정확도를 유지하는 적응적 추론을 달성합니다.
The accuracy of deep convolutional neural networks (CNNs) generally improves when fueled with high resolution images. However, this often comes at a high computational cost and high memory footprint. Inspired by the fact that not all regions in an image are task-relevant, we propose a novel framework that performs efficient image classification by processing a sequence of relatively small inputs, which are strategically selected from the original image with reinforcement learning. Such a dynamic decision process naturally facilitates adaptive inference at test time, i.e., it can be terminated once the model is sufficiently confident about its prediction and thus avoids further redundant computation. Notably, our framework is general and flexible as it is compatible with most of the state-of-the-art light-weighted CNNs (such as MobileNets, EfficientNets and RegNets), which can be conveniently deployed as the backbone feature extractor. Experiments on ImageNet show that our method consistently improves the computational efficiency of a wide variety of deep models. For example, it further reduces the average latency of the highly efficient MobileNet-V3 on an iPhone XS Max by 20% without sacrificing accuracy. Code and pre-trained models are available at https://github.com/blackfeather-wang/GFNet-Pytorch.
연구 동기 및 목표
- 고해상도 이미지 분류에서 공간 중복성을 활용하여 계산량을 줄이는 것을 모티브로 삼는다.
- 두 단계 프레임워크( glance 와 focus )를 개발하여 작은 입력을 적응적으로 처리하고 확신이 있을 때 종료한다.
- 경량 백본(예: MobileNet, EfficientNet, RegNet)과의 호환성을 보장하여 효율적인 추론을 가능하게 한다.
제안 방법
- 다운샘플된 전체 이미지( glance )로 시작하는 일련의 작은 입력을 처리한다.
- 패치 제안 네트워크를 사용하여 이후의 focus 단계에서 판별 가능한 영역을 로컬라이즈한다.
- 순환 분류기를 사용하여 각 단계에서 예측을 내고 신뢰도에 따라 조기 종료를 한다.
- 패치 선택을 정책 그래디언트로 학습하여 클래스 확률의 증가를 극대화한다.
- 설정 가능한 신뢰도 임계값(예산형/언제든지 인퍼런스 설정)으로 온라인 상의 계산 제어를 허용한다.
- 선형적으로 구분 가능한 특징을 장려하고 위치 선정을 개선하기 위해 인코더를 정규화하는 옵션이 있다.
실험 결과
연구 질문
- RQ1연속적인 패치 기반 처리 전략이 고해상도 이미지에서 계산량을 줄이면서 분류 정확도를 유지할 수 있는가?
- RQ2어떻게 판별 영역을 선택하고 이미지 간 계산을 적응적으로 할당해야 하는가?
- RQ3예산형 및 언제든지(in budgeted and anytime) 인퍼런스 작업에서 GFNet이 최첨단 경량 CNN 백본과 어떻게 수행되는가?
- RQ4시선 유사한 glance 단계와 focus 단계가 정확도와 지연 시간에 미치는 영향은 무엇인가?
주요 결과
- GFNet은 MobileNet-V3, RegNet-Y, EfficientNet, ResNet, DenseNet 백본에서 일관되게 효율성을 향상시킨다.
- MobileNet-V3의 경우 GFNet은 유사한 정확도에서 곱하기-추가 연산을 최대 1.4배 감소시킨다.
- ResNet 계열과 DenseNet에서 동일한 정확도에 대해 대략 2~3배의 계산 감소를 달성한다.
- iPhone XS Max에서 관련 백본에 대해 GFNet이 약 1.3배에서 2.9배의 지연 시간 속도 향상을 제공한다.
- GFNet은 정확도 손실을 최소화하면서 예산에 맞게 계산량을 온라인으로 조정하게 한다.
- GFNet은 MSDNet과 같은 기준선 대비 예산된 배치 분류 및 언제든지 예측에서 경쟁력 있는 혹은 우수한 정확도를 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.