Skip to main content
QUICK REVIEW

[論文レビュー] Attention Based Pruning for Shift Networks

Ghouthi Boukli Hacene, Lassance, Carlos|arXiv (Cornell University)|Feb 28, 2019
Advanced Neural Network Applications参考文献 33被引用数 15
ひとこと要約

本稿では、学習中に最適なシフトを自動で学習するアテンションベースのプルーニング機構、シフトアテンションレイヤー(SALs)を提案する。固定の手作業によるシフトに代わって、各特徴マップごとに最も関連性の高いシフトを微分可能アテンション機構で動的に選択することで、SALsは、従来のシフトレイヤーや標準的なCNNと比較して、顕著に高い精度を達成するとともに、FLOPsとパラメータ数を大幅に削減する。これは、リソース制限のある推論に最適である。

ABSTRACT

In many application domains such as computer vision, Convolutional Layers (CLs) are key to the accuracy of deep learning methods. However, it is often required to assemble a large number of CLs, each containing thousands of parameters, in order to reach state-of-the-art accuracy, thus resulting in complex and demanding systems that are poorly fitted to resource-limited devices. Recently, methods have been proposed to replace the generic convolution operator by the combination of a shift operation and a simpler 1x1 convolution. The resulting block, called Shift Layer (SL), is an efficient alternative to CLs in the sense it allows to reach similar accuracies on various tasks with faster computations and fewer parameters. In this contribution, we introduce Shift Attention Layers (SALs), which extend SLs by using an attention mechanism that learns which shifts are the best at the same time the network function is trained. We demonstrate SALs are able to outperform vanilla SLs (and CLs) on various object recognition benchmarks while significantly reducing the number of float operations and parameters for the inference.

研究の動機と目的

  • 固定の手作業によるシフトの非効率性を解消し、トレーニング中に最適なシフトを学習すること。
  • 深層学習モデルのリソース制限のあるデバイスにおけるモデルの複雑さとFLOPsを削減しながら、精度を損なわないこと。
  • アテンションベースの動的選択を統合することで、従来のプルーニングおよび圧縮技術を改善すること。
  • 標準的なビジョンベンチマーク上で、学習されたシフトが静的シフトを上回る精度と効率を示すことを実証すること。

提案手法

  • 各特徴マップごとに最重要なシフトを選択するための学習可能なアテンション機構を備えたシフトアテンションレイヤー(SALs)を提案する。
  • 各カーネル内のシフト位置に対する重要度スコアを割り当てるアテンションテンソルAを導入し、バックプロパゲーション中に値を更新する。
  • 温度制御されたソフトマックスをAに適用して、シフトの微分可能選択を可能にし、推論時には最終値を二値に丸める。
  • ネットワーク全体をエンドツーエンドで訓練することで、アテンション機構が各特徴マップに対して最も効果的なシフトを学習できるようにする。
  • 最高のアテンションスコアを持つシフトのみを保持する微分可能プルーニング戦略を採用し、標準的な畳み込みをシフトレイヤーに効果的に変換する。
  • 訓練の安定化と二値アテンション値への収束を向上させるために、知識蒸留と温度スケジューリングを採用する。

実験結果

リサーチクエスチョン

  • RQ1アテンション機構を用いて、シフトネットワークにおける最適なシフトを学習可能か? その結果、固定の手作業によるシフトを上回る性能が得られるか?
  • RQ2アテンションベースのシフト選択をエンドツーエンドで訓練することで、標準的な畳み込みネットワークやヴァナイルシフトネットワークと比較して、より高い精度と効率が達成できるか?
  • RQ3温度スケジューリングの選択が、アテンションベースのプルーニング機構の収束性と性能に与える影響はいかほどか?
  • RQ4SALsは、ImageNetおよびCIFARデータセットにおいて、トップ1精度を維持または向上させながら、FLOPsとパラメータ数をどの程度削減できるか?
  • RQ5バイナリ化やモバイルアーキテクチャなどの他の圧縮技術と比較して、SALsは精度とメモリフットプリントの面でどの程度優れているか?

主な発見

  • ImageNet ILSVRC 2012で、3.3Mパラメータと538M FLOPsの条件下で、SALsは71%のトップ1精度を達成し、ヴァナイルシフトネット(70.1%)および同程度の制約下での標準CNNを上回った。
  • CIFAR-10では、ResNet-w64にSALsを適用した場合、93.5%のテスト精度に到達し、標準のResNet-w64およびヴァナイルシフトネットを上回った。
  • SALsは、標準のResNet-w64と比較して、FLOPsを18%、パラメータ数を20%削減しながらも、より高い精度を維持した。
  • ResNet-20では、Binary ConnectやBinary Weight Networksを上回り、94.2%の精度を達成し、より低いメモリフットプリントを実現した。
  • 温度スケジューリングは性能に顕著な影響を与える:温度が高すぎたり、急激に減少しすぎると収束が悪化するが、最適なスケジューリング(初期T ≈ 6.7、最終T ≈ 0.02)が最良の結果をもたらした。
  • 1つのカーネルあたり2つの重みを保持するSAL2は、さらに精度を向上させ、複数のシフトを学習することが有益であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。