Skip to main content
QUICK REVIEW

[論文レビュー] DepthShrinker: A New Compression Paradigm Towards Boosting Real-Hardware Efficiency of Compact Neural Networks

Yonggan Fu, Haichuan Yang|arXiv (Cornell University)|Jun 2, 2022
Advanced Neural Network Applications被引用数 7
ひとこと要約

DepthShrinker は、コンpactなニューラルネットワークの実ハードウェア効率を向上させるための新しい圧縮パラダイムを提案している。具体的には、逆残差ブロック内の連続する層(特に深度方向畳み込みとポイントワイド畳み込み)を、不要な活性化関数を特定・削除した後、1つの密な畳み込みに統合することで実現している。この手法により、Tesla V100 で最大 1.53× のスループット向上と、最先端のチャネルプルーニング手法を上回る 3.06% の精度向上が達成された。

ABSTRACT

Efficient deep neural network (DNN) models equipped with compact operators (e.g., depthwise convolutions) have shown great potential in reducing DNNs' theoretical complexity (e.g., the total number of weights/operations) while maintaining a decent model accuracy. However, existing efficient DNNs are still limited in fulfilling their promise in boosting real-hardware efficiency, due to their commonly adopted compact operators' low hardware utilization. In this work, we open up a new compression paradigm for developing real-hardware efficient DNNs, leading to boosted hardware efficiency while maintaining model accuracy. Interestingly, we observe that while some DNN layers' activation functions help DNNs' training optimization and achievable accuracy, they can be properly removed after training without compromising the model accuracy. Inspired by this observation, we propose a framework dubbed DepthShrinker, which develops hardware-friendly compact networks via shrinking the basic building blocks of existing efficient DNNs that feature irregular computation patterns into dense ones with much improved hardware utilization and thus real-hardware efficiency. Excitingly, our DepthShrinker framework delivers hardware-friendly compact networks that outperform both state-of-the-art efficient DNNs and compression techniques, e.g., a 3.06% higher accuracy and 1.53$ imes$ throughput on Tesla V100 over SOTA channel-wise pruning method MetaPruning. Our codes are available at: https://github.com/facebookresearch/DepthShrinker.

研究の動機と目的

  • 深く畳み込みのような不規則な演算(例:深度方向畳み込み)によるハードウェア利用効率の低さが原因で生じる、理論的効率と実ハードウェア効率のギャップを是正すること。
  • 効率的な DNN ブロック内の活性化関数が、推論精度に影響を与えない場合に、トレーニング後に削除可能かどうかを検証すること。
  • 不規則で低利用効率な演算を、密で並列性の高い層に変換することで、ハードウェア利用効率を向上させる新しい圧縮パラダイムを構築すること。
  • 既存のプルーニングや圧縮技術を上回る、高いモデル精度と優れたハードウェア効率を両立すること。
  • GPU、エッジデバイス、CPU を含む多様なハードウェアプラットフォームへの一般化可能性を実証すること。

提案手法

  • 推論精度に影響を与えないことが判明した効率的 DNN ブロック(例:逆残差)の内部層から活性化関数を同定・削除する。
  • 残りの線形演算(ポイントワイド畳み込みと深度方向畳み込み)を、同等のカーネルサイズとチャネル次元を持つ単一の密な畳み込みに統合する。
  • トレーニング中に安全に削除可能な活性化関数を自動同定するために、微分可能探索機構を用いる。
  • まず自由な活性化関数を追加してネットワークを拡張し、その後 DepthShrinker プロセスでそれらをプルーニングすることで、トレーニングの安定性を向上させる「拡張・次に縮小」戦略を採用する。
  • Pixel 3 や Raspberry Pi 4 などの CPU ベースのエッジデバイスでの評価を目的として、変換後のモデルを ONNX および TFLite 形式に変換する。
  • 密な畳み込みの向上したデータ再利用性と並列性を活用し、現代のアクセラレータ上でハードウェア利用効率を最大化する。

実験結果

リサーチクエスチョン

  • RQ1効率的な DNN ブロック内の活性化関数は、トレーニング後に削除可能であり、モデル精度に悪影響を及げないか?
  • RQ2連続する線形層(例:深度方向畳み込みとポイントワイド畳み込み)を1つの密な層に統合することで、ハードウェア利用効率と実世界の推論速度が向上するか?
  • RQ3提案された DepthShrinker フレームワークは、既存のチャネルワイドおよびレイヤーワイドプルーニング手法と比較して、精度とスループットの両面で優れているか?
  • RQ4DepthShrinker アプローチは、CPU やエッジデバイスを含む多様なハードウェアプラットフォームに一般化可能か?
  • RQ5「拡張・次に縮小」トレーニング戦略は、MobileNetV2 や VGG11 などのコンパクトモデルの性能を向上させるか?

主な発見

  • Tesla V100 では、DepthShrinker は SOTA チャネルワイドプルーニング手法 MetaPruning よりも 1.53× の高いスループットと 3.06% の高いトップ-1精度を達成した。
  • RTX 2080Ti GPU では、DepthShrinker はランダムサーチベースラインと比較して、精度で 4.30–5.46% 向上し、スループットで 1.19–1.24× 向上した。
  • CPU デバイスでは、Raspberry Pi 4 で最大 43.1%、Google Pixel 3 で最大 38.4% の遅延低減が達成され、精度は同等の水準を維持した。
  • 「拡張・次に縮小」戦略により、ImageNet における VGG11、VGG13、MCUNet、MobileNetV2 で精度が 1.26–1.62% 向上した。
  • 密な畳み込みによるデータ再利用性と並列性の向上のおかげで、GPU、エッジGPU、モバイルCPUにわたり、一貫したハードウェア効率の向上が確認された。
  • 実験により、特定の活性化関数の削除が精度に悪影響を及えないことが確認され、層を安全に密な演算に統合することが可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。