[論文レビュー] SGAD: Soft-Guided Adaptively-Dropped Neural Network
本稿では、入力サンプルの分類難易度に応じて動的に残差ブロックをスキップすることで計算コストを低減する、ソフトガイド付きの適応的ドロップ機構を備えたニューラルネットワークSGADを提案する。学習可能なソフトガイドラインとストレートスラッシュ推定を用いることで、ResNet-32と比較してCIFAR-10で77%のFLOP削減を達成し、精度低下は1%未満に抑えられる。
Deep neural networks (DNNs) have been proven to have many redundancies. Hence, many efforts have been made to compress DNNs. However, the existing model compression methods treat all the input samples equally while ignoring the fact that the difficulties of various input samples being correctly classified are different. To address this problem, DNNs with adaptive dropping mechanism are well explored in this work. To inform the DNNs how difficult the input samples can be classified, a guideline that contains the information of input samples is introduced to improve the performance. Based on the developed guideline and adaptive dropping mechanism, an innovative soft-guided adaptively-dropped (SGAD) neural network is proposed in this paper. Compared with the 32 layers residual neural networks, the presented SGAD can reduce the FLOPs by 77% with less than 1% drop in accuracy on CIFAR-10.
研究の動機と目的
- すべての入力サンプルに同一の処理を施す既存のモデル圧縮手法の非効率性を是正し、分類難易度の差を無視しないこと。
- 入力に応じた適応的計算を可能にすることで、深層ニューラルネットワークにおける計算の冗長性を低減すること。
- 精度を損なわず、サンプルの難易度に応じて動的に残差ブロックをスキップする学習可能なメカニズムを開発すること。
- 離散的なドロップ決定に起因する非微分性を克服するため、ソフトガイド付きでエンドツーエンド学習可能なフレームワークを導入すること。
- 学習されたドロップ行動を検証し、難易度の高いサンプルに対して高いモデル容量が維持されることを確認すること。
提案手法
- 各入力サンプルの分類難易度を定量化するために、ソフトmax層出力から導出されるソフトガイドラインを導入する。
- 学習可能なマッピング戦略を用いて、訓練中にサンプルの難易度と望ましいブロックドロップ比を一致させる。
- 勾配逆伝播を可能にするために、非微分可能な丸め関数を近似するためのストレートスラッシュ推定器(STE)を備えたバイナリマスク生成器を実装する。
- エンドツーエンドで訓練する際、ソフトガイドラインと学習されたしきい値に基づいてブロックをスキップする適応的ドロップ機構を適用する。
- 推論時においてはソフトガイドラインを削除することで、追加のオーバーヘッドなしに低遅延推論を実現する。
- 効率的なブロックスキップを可能にするために、残差ネットワーク(ResNet)アーキテクチャをベースとして採用する。
実験結果
リサーチクエスチョン
- RQ1ソフトガイド付き機構は、深層ニューラルネットワーク内での個々の入力サンプルの分類難易度を効果的に定量化できるか?
- RQ2ドロップ決定が離散的かつ非微分的である場合、どのようにしてエンドツーエンドで適応的ブロックドロップを学習できるか?
- RQ3入力に応じた計算によって、計算コストをどの程度低減しつつ、精度を維持または向上できるか?
- RQ4どの残差ブロックが最もスキップされやすいか?また、その行動はモデル容量への寄与と相関しているか?
- RQ5FLOP削減と精度の両面において、既存の適応的推論技術に比べ、本手法は優れているか?
主な発見
- CIFAR-10において、SGADはResNet-32と比較して77%のFLOPs削減を達成し、精度低下は1%未満である。
- CIFAR-100では、SGADはResNet-32と比較して0.47%の精度向上を達成するとともに、FLOPsを23%削減した。
- CIFAR-10およびCIFAR-100の両方において、SACT、ACT、SkipNet、BlockDropと比較して、精度とFLOP効率の両面で本手法が優れていることが確認された。
- 勾配の大きさが小さいブロックほどスキップされやすく、重要度が低い層が優先的にドロップされていることが示された。
- 訓練後、一部のブロックがすべての入力に対して非活性化(FLOPsがゼロ)となり、モデルのプルーニングが可能になり、メモリ使用量が削減された。
- 勾配の大きさが大きいブロックを保持することで、学習されたドロップ行動は、分類精度への寄与が大きいブロックのモデル容量を維持している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。