Skip to main content
QUICK REVIEW

[논문 리뷰] Attention Based Pruning for Shift Networks

Ghouthi Boukli Hacene, Lassance, Carlos|arXiv (Cornell University)|2019. 02. 28.
Advanced Neural Network Applications참고 문헌 33인용 수 15
한 줄 요약

이 논문은 훈련 중에 최적의 이동을 학습하는 주의 기반 프루닝 메커니즘인 시프트 어텐션 레이어(Shift Attention Layers, SALs)를 제안한다. 이는 고정된 수작업으로 설계된 이동 방식을 대체한다. 각 특징 맵에 대해 유연한 주의 메커니즘을 사용해 가장 관련성이 높은 이동을 동적으로 선택함으로써, SALs는 표준 시프트 레이어와 일반적인 CNN보다 높은 정확도를 달성하면서도 FLOPs와 파라미터를 크게 감소시켜 자원이 제한된 환경에서의 추론에 이상적이다.

ABSTRACT

In many application domains such as computer vision, Convolutional Layers (CLs) are key to the accuracy of deep learning methods. However, it is often required to assemble a large number of CLs, each containing thousands of parameters, in order to reach state-of-the-art accuracy, thus resulting in complex and demanding systems that are poorly fitted to resource-limited devices. Recently, methods have been proposed to replace the generic convolution operator by the combination of a shift operation and a simpler 1x1 convolution. The resulting block, called Shift Layer (SL), is an efficient alternative to CLs in the sense it allows to reach similar accuracies on various tasks with faster computations and fewer parameters. In this contribution, we introduce Shift Attention Layers (SALs), which extend SLs by using an attention mechanism that learns which shifts are the best at the same time the network function is trained. We demonstrate SALs are able to outperform vanilla SLs (and CLs) on various object recognition benchmarks while significantly reducing the number of float operations and parameters for the inference.

연구 동기 및 목표

  • 고정된 수작업으로 설계된 이동 방식의 비효율성을 해결하기 위해, 훈련 중 최적의 이동을 학습하는 것.
  • 딥러닝 모델의 모델 복잡도와 FLOPs를 정확도를 희생시키지 않고 자원이 제한된 장치에서 줄이는 것.
  • 주의 기반 동적 선택 방식을 통합함으로써 기존의 프루닝 및 압축 기법을 향상시키는 것.
  • 표준 비전 벤치마크에서 학습된 이동 방식이 정적 이동보다 정확도와 효율성 면에서 뛰어나다는 것을 입증하는 것.

제안 방법

  • 각 특징 맵에 대해 가장 중요한 이동을 선택하기 위해 학습 가능한 주의 메커니즘을 사용하는 시프트 어텐션 레이어(SALs)를 제안한다.
  • 커널 내 각 이동 위치에 대한 중요도 점수를 할당하는 주의 텐서 A를 도입하며, 이 값은 역전파 동안 업데이트된다.
  • 이동 선택을 미분 가능하게 하기 위해 온도 조절 소프트맥스를 적용하며, 추론 시 최종 값은 이진화되어 반올림된다.
  • 주의 메커니즘이 각 특징 맵에 대해 가장 효과적인 이동을 학습할 수 있도록 네트워크를 종합적으로 훈련한다.
  • 오직 가장 높은 주의도를 가진 이동만 유지되는 미분 가능한 프루닝 전략을 사용하여, 표준 컨볼루션을 시프트 레이어로 효과적으로 변환한다.
  • 훈련 안정성 향상과 이진 주의 값 수렴을 위해 지식 증류와 온도 스케줄링을 활용한다.

실험 결과

연구 질문

  • RQ1주의 메커니즘을 사용해 시프트 네트워크 내 최적의 이동을 학습할 수 있는가? 이는 고정된 수작업 이동보다 성능 향상을 이끌 수 있는가?
  • RQ2주의 기반 이동 선택의 종합적 훈련이 표준 컨볼루션 및 보편적인 시프트 네트워크보다 더 높은 정확도와 효율성을 달성하는가?
  • RQ3온도 스케줄링의 선택이 주의 기반 프루닝 메커니즘의 수렴과 성능에 어떤 영향을 미치는가?
  • RQ4SALs는 ImageNet 및 CIFAR 데이터셋에서 상위 1위 정확도를 유지하거나 향상시키면서 FLOPs와 파라미터를 얼마나 줄일 수 있는가?
  • RQ5이진화 및 모바일 아키텍처와 같은 다른 압축 기법과 비교했을 때 SAL은 정확도와 메모리 프로파일 측면에서 어떻게 성능을 냈는가?

주요 결과

  • SALs는 330만 개의 파라미터와 5.38억 개의 FLOPs를 사용해 ImageNet ILSVRC 2012에서 71%의 상위 1위 정확도를 달성했으며, 이는 표준 시프트 네트워크(70.1%)와 유사한 조건에서 더 높은 성능을 보였다.
  • CIFAR-10에서 SALs를 적용한 ResNet-w64는 93.5%의 테스트 정확도를 기록했으며, 이는 표준 ResNet-w64와 보편적인 시프트 네트워크를 모두 초월했다.
  • SALs를 적용한 결과, 표준 ResNet-w64 대비 FLOPs는 18% 감소하고 파라미터는 20% 감소했으며, 더 높은 정확도를 유지했다.
  • ResNet-20에서 Binary Connect와 Binary Weight Networks를 초월해 94.2%의 정확도를 달성했으며, 더 낮은 메모리 프로파일을 확보했다.
  • 온도 스케줄링은 성능에 큰 영향을 미쳤다: 너무 높거나 너무 빠른 감쇠는 수렴을 악화시키지만, 최적의 스케줄링(초기 T ≈ 6.7, 최종 T ≈ 0.02)은 최상의 성능을 이끌어냈다.
  • SAL2는 커널당 두 개의 가중치를 유지하여 정확도를 더욱 향상시켰으며, 다중 이동을 학습하는 것이 유리할 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.