Skip to main content
QUICK REVIEW

[論文レビュー] Fractional Skipping: Towards Finer-Grained Dynamic CNN Inference

Jianghao Shen, Yonggan Fu|arXiv (Cornell University)|Jan 3, 2020
Advanced Neural Network Applications参考文献 31被引用数 7
ひとこと要約

本稿では、入力に応じたレイヤスキッピングと量子化を統合するためのフレームワークである動的分数スキッピング(DFS)を提案する。DFSは、レイヤごとのビット幅割り当てを、完全実行と完全スキップの間の『分数的』な実行オプションとして扱い、重みと活性化の入力依存的で動的なビット幅割り当てにより、より細かい精度-計算量のトレードオフを実現する。従来のバイナリスキッピングや静的量子化手法に比べて優れた性能を達成する。

ABSTRACT

While increasingly deep networks are still in general desired for achieving state-of-the-art performance, for many specific inputs a simpler network might already suffice. Existing works exploited this observation by learning to skip convolutional layers in an input-dependent manner. However, we argue their binary decision scheme, i.e., either fully executing or completely bypassing one layer for a specific input, can be enhanced by introducing finer-grained, "softer" decisions. We therefore propose a Dynamic Fractional Skipping (DFS) framework. The core idea of DFS is to hypothesize layer-wise quantization (to different bitwidths) as intermediate "soft" choices to be made between fully utilizing and skipping a layer. For each input, DFS dynamically assigns a bitwidth to both weights and activations of each layer, where fully executing and skipping could be viewed as two "extremes" (i.e., full bitwidth and zero bitwidth). In this way, DFS can "fractionally" exploit a layer's expressive power during input-adaptive inference, enabling finer-grained accuracy-computational cost trade-offs. It presents a unified view to link input-adaptive layer skipping and input-adaptive hybrid quantization. Extensive experimental results demonstrate the superior tradeoff between computational cost and model expressive power (accuracy) achieved by DFS. More visualizations also indicate a smooth and consistent transition in the DFS behaviors, especially the learned choices between layer skipping and different quantizations when the total computational budgets vary, validating our hypothesis that layer quantization could be viewed as intermediate variants of layer skipping. Our source code and supplementary material are available at \link{https://github.com/Torment123/DFS}.

研究の動機と目的

  • バイナリレイヤスキッピングの非効率性に対処すること。これは各レイヤーを完全実行または完全スキップのいずれかに分類するため、精度と計算コストの間で粗いトレードオフが生じる。
  • レイヤ量子化が、完全実行とスキップの間の『分数的』な中間状態として機能するかどうかを検討すること。これにより、より滑らかで柔軟なモデル適合が可能になる。
  • 重みと活性化の各レイヤーに対して入力に応じて動的にビット幅を割り当てる統合フレームワークを構築すること。これにより、計算複雑性とモデル表現力のより細かい制御が可能になる。
  • 量子化が動的推論パイプラインにおける自然なソフトな中間オプションとして機能することを実証的に検証すること。スキップ、量子化、完全実行の間で滑らかな遷移が実現されるかを検証する。

提案手法

  • DFSは、レイヤごとの量子化(異なるビット幅に)を、完全実行(全ビット幅)とスキップ(ゼロビット幅)の間の『ソフト』な意思決定として定式化し、分数量りスキッピングを可能にする。
  • 入力に応じたビット幅割り当てを学習するための2段階の訓練手順を採用し、計算制約下での精度最適化を図る。
  • 入力の特徴に基づいて、各レイヤーでスキップ、8ビット、4ビット、または全精度実行のいずれかを選択できる微分可能意思決定メカニズムを導入する。
  • 動的推論と量子化を1つの統合最適化目的関数に統合し、勾配ベース最適化によるエンドツーエンド訓練を可能にする。
  • 推論コストの総合的割合(cp)を制御ノブとして用い、cpが増加するに従い意思決定が滑らかに変化するように制御する。
  • cpレベルを変化させた際のレイヤごとの意思決定分布の可視化により、スキップから量子化、最終的に完全実行への滑らかな遷移が確認され、仮説の妥当性が裏付けられる。

実験結果

リサーチクエスチョン

  • RQ1レイヤ量子化は、動的畳み込みニューラルネットワーク推論において、完全実行と完全スキップの間の『分数的』な中間状態として意味的に解釈可能か?
  • RQ2レイヤごとに入力に応じた動的ビット幅割り当ては、バイナリレイヤスキッピングや固定量子化よりも、より優れた精度-計算量トレードオフを実現するか?
  • RQ3計算予算が増加するに従い、DFSの学習された意思決定行動は滑らかにどのように変化するか?また、量子化がソフトスキッピングの一種であるという仮説を支持するか?
  • RQ4さまざまな計算制約下で、DFSは既存の最先端手法をどの程度上回るか?

主な発見

  • DFSは、元の計算予算の6.25%にまで制限された状態でCIFAR-10で93.54%のトップ1精度を達成し、優れた効率性-精度トレードオフを示した。
  • 計算パcent(cp)を4%から6.25%に増加させた際、DFSの精度は92.91%から93.54%に向上し、量子化によるより細かい制御のおかげで顕著な向上が確認された。
  • 可視化結果から、cpが増加するに従い、レイヤスキップから8ビット量子化、最終的に完全実行への滑らかな遷移が観察され、量子化がソフトな中間状態として機能しているという仮説が裏付けられた。
  • 各残差ブロックの最初の残差ブロックが一貫して選択(スキップされない)されており、既知のアーキテクチャ的重みと整合しており、モデルの学習された意思決定論理の妥当性が検証された。
  • 複数のベンチマークにおいて、DFSはバイナリレイヤスキッピングおよび静的量子化ベースラインを上回り、特に低計算量環境下で顕著な優位性を示した。
  • 異なるビット幅において一貫した挙動を示しており、中程度の計算量環境では8ビット量子化が最も多く選択されており、これが主要な中間オプションとしての役割を果たしていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。