Skip to main content
QUICK REVIEW

[논문 리뷰] Fractional Skipping: Towards Finer-Grained Dynamic CNN Inference

Jianghao Shen, Yonggan Fu|arXiv (Cornell University)|2020. 01. 03.
Advanced Neural Network Applications참고 문헌 31인용 수 7
한 줄 요약

이 논문은 입력에 적응하는 레이어 스킵과 양자화를 통합하는 프레임워크인 동적 분수 스킵(Dynamic Fractional Skipping, DFS)을 제안한다. 이는 레이어별 비트폭 할당을 전체 실행과 완전한 스킵 사이의 중간 상태로 간주함으로써, 전체 실행과 완전한 스킵 사이의 '분수' 실행 옵션으로서의 기능을 수행한다. DFS는 입력에 따라 가중치와 활성화에 대해 동적으로 비트폭을 할당함으로써 더 세밀한 정확도-계산량 트레이드오프를 가능하게 하여, 이진 스킵과 정적 양자화 방법보다 뛰어난 성능을 달성한다.

ABSTRACT

While increasingly deep networks are still in general desired for achieving state-of-the-art performance, for many specific inputs a simpler network might already suffice. Existing works exploited this observation by learning to skip convolutional layers in an input-dependent manner. However, we argue their binary decision scheme, i.e., either fully executing or completely bypassing one layer for a specific input, can be enhanced by introducing finer-grained, "softer" decisions. We therefore propose a Dynamic Fractional Skipping (DFS) framework. The core idea of DFS is to hypothesize layer-wise quantization (to different bitwidths) as intermediate "soft" choices to be made between fully utilizing and skipping a layer. For each input, DFS dynamically assigns a bitwidth to both weights and activations of each layer, where fully executing and skipping could be viewed as two "extremes" (i.e., full bitwidth and zero bitwidth). In this way, DFS can "fractionally" exploit a layer's expressive power during input-adaptive inference, enabling finer-grained accuracy-computational cost trade-offs. It presents a unified view to link input-adaptive layer skipping and input-adaptive hybrid quantization. Extensive experimental results demonstrate the superior tradeoff between computational cost and model expressive power (accuracy) achieved by DFS. More visualizations also indicate a smooth and consistent transition in the DFS behaviors, especially the learned choices between layer skipping and different quantizations when the total computational budgets vary, validating our hypothesis that layer quantization could be viewed as intermediate variants of layer skipping. Our source code and supplementary material are available at \link{https://github.com/Torment123/DFS}.

연구 동기 및 목표

  • 이진 레이어 스킵의 비효율성을 해결하기 위해, 각 레이어를 완전히 실행하거나 완전히 스킵하는 방식은 정확도와 계산 비용 사이에 굵은 트레이드오프를 초래하므로 이를 개선하고자 한다.
  • 레이어 양자화가 전체 실행과 스킵 사이의 '분수' 중간 상태로 기능할 수 있는지 탐색하고자 한다.
  • 입력에 따라 가중치와 활성화에 대해 레이어별로 비트폭을 동적으로 할당할 수 있는 통합 프레임워크를 개발하여 계산 복잡도와 모델 표현력에 대한 더 세밀한 제어를 가능하게 하고자 한다.
  • 양자화가 동적 추론 파이프라인에서 자연스러운 부드러운 중간 선택지로 작용함을 경험적으로 검증하고자 한다. 이는 스킵, 양자화, 전체 실행 사이의 부드러운 전이를 가능하게 한다.

제안 방법

  • DFS는 레이어별로 다양한 비트폭으로의 양자화를 전체 실행(전체 비트폭)과 스킵(0비트폭) 사이의 중간 '부드러운' 결정으로 간주하여 분수 스킵을 가능하게 한다.
  • 모델이 입력 특성에 따라 각 레이어에서 스킵, 8비트, 4비트, 또는 전체 정밀도 실행을 동적으로 선택할 수 있도록 가능한 미분 가능한 决정 메커니즘을 도입한다.
  • 동적 추론과 양자화를 하나의 통합 최적화 목표로 통합하여, 기울기 기반 최적화를 통해 엔드 투 엔드 학습이 가능하도록 한다.
  • 총 추론 비용을 조절하기 위한 제어 장치로 계산량 퍼centile(cp) 예산을 사용하며, cp가 증가함에 따라 결정이 부드럽게 변화한다.
  • 다양한 cp 수준에서의 레이어별 결정 분포 시각화를 통해 스킵에서 양자화로, 그리고 결국 전체 실행으로의 일관되고 부드러운 전이가 관찰된다.

실험 결과

연구 질문

  • RQ1동적 컨volution 네트워크 추론에서 레이어 양자화는 전체 레이어 실행과 완전한 스킵 사이의 '분수' 중간 상태로 의미적으로 해석될 수 있는가?
  • RQ2레이어 간 입력에 적응하는 동적 비트폭 할당은 이진 레이어 스킵이나 고정된 양자화보다 더 나은 정확도-계산량 트레이드오프를 제공하는가?
  • RQ3계산 예산이 증가함에 따라 DFS의 학습된 결정 행동은 어떻게 부드럽게 변화하는가? 그리고 양자화가 부드러운 스킵의 변형으로서의 가정을 지지하는가?
  • RQ4다양한 계산 제약 조건 하에서 DFS는 기존 최첨단 방법보다 얼마나 더 뛰어난 정확도를 달성하는가?

주요 결과

  • DFS는 원래 계산 예산의 6.25%만으로 CIFAR-10에서 93.54%의 상위-1 정확도를 달성하여 효율성-정확도 트레이드오프 측면에서 뛰어난 성능을 보였다.
  • 계산량 퍼센트가 4%에서 6.25%로 증가함에 따라 DFS의 정확도는 92.91%에서 93.54%로 향상되었으며, 이는 양자화를 통한 더 세밀한 제어가 가져온 상당한 성능 향상임을 시사한다.
  • 시각화 결과는 cp가 증가함에 따라 스킵에서 8비트 양자화로, 그리고 결국 전체 실행으로의 부드러운 전이가 관찰되었으며, 이는 양자화가 부드러운 중간 상태로 기능한다는 가정을 지지한다.
  • 각 잔차 블록의 첫 번째 잔차 블록은 항상 선택됨(절대 스킵되지 않음)으로서, 알려진 아키텍처적 중요성과 일치하며 모델의 학습된 결정 논리가 타당함을 검증한다.
  • 다양한 벤치마크에서 DFS는 이진 레이어 스킵 및 정적 양자화 기반선보다 뛰어난 성능을 보였으며, 특히 저계산량 환경에서 두드러진 성능 향상을 보였다.
  • 모델은 다양한 비트폭에서 일관된 행동를 보이며, 중간 계산량 설정에서는 8비트 양자화가 주로 선택됨으로써 이가 핵심 중간 선택지로서의 역할을 수행하고 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.