[論文レビュー] An end-to-end approach for speeding up neural network inference
本稿では、バッチ活性化損失とGumbel再パrameterizationを用いて動的ネットワーク構造を学習することで、ニューラルネットワークの推論速度と精度を同時に最適化するエンドツーエンドフレームワークを提案する。本手法は、プルーニングと条件付き計算の両方を可能にし、ImageNet分類においてResNetでは45–52%、MobileNetV2では19–37%の計算量削減を達成しながら、顕著な精度の低下を伴わない。
Important applications such as mobile computing require reducing the computational costs of neural network inference. Ideally, applications would specify their preferred tradeoff between accuracy and speed, and the network would optimize this end-to-end, using classification error to remove parts of the network \cite{lecun1990optimal,mozer1989skeletonization,BMVC2016_104}. Increasing speed can be done either during training -- e.g., pruning filters \cite{li2016pruning} -- or during inference -- e.g., conditionally executing a subset of the layers \cite{aig}. We propose a single end-to-end framework that can improve inference efficiency in both settings. We introduce a batch activation loss and use Gumbel reparameterization to learn network structure \cite{aig,jang2016categorical}. We train end-to-end against batch activation loss combined with classification loss, and the same technique supports pruning as well as conditional computation. We obtain promising experimental results for ImageNet classification with ResNet \cite{he2016resnet} (45-52\% less computation) and MobileNetV2 \cite{sandler2018mobilenetv2} (19-37\% less computation).
研究の動機と目的
- モバイルコンピューティングなどの実世界の応用において、ニューラルネットワークの推論速度と精度のトレードオフをエンドツーエンドで最適化すること。
- 推論中にモデルプルーニングと条件付き計算の両方をサポートする統合フレームワークの開発。
- 学習可能なネットワーク構造を通じて、分類性能を損なわず計算コストを低減すること。
- バッチ活性化損失と分類損失の組み合わせを用いて、ネットワークをエンドツーエンドで訓練すること。
提案手法
- 訓練中にネットワーク構造の学習を導くために、バッチ活性化損失を導入する。
- 離散的構造の微分可能なサンプリングを可能にするために、Gumbel再パラメータ化を用いる。これにより、ネットワークアーキテクチャの選択経路での誤差逆伝播が可能になる。
- バッチ活性化損失と標準的な分類損失の組み合わせを用いて、ネットワークをエンドツーエンドで訓練する。
- どのコンponentを保持するか、または有効化するかを学習することで、フィルタープルーニングとレイヤーの条件付き実行を両立させる。
- ImageNet分類タスクに対して、ResNetおよびMobileNetV2に本フレームワークを適用する。
実験結果
リサーチクエスチョン
- RQ1単一のエンドツーエンドフレームワークが、ニューラルネットワークにおける推論速度と精度の両方を同時に最適化できるか?
- RQ2Gumbel再パラメータ化が、プルーニングと条件付き計算の両方の動的ネットワーク構造を効果的に学習できるか?
- RQ3提案手法が顕著な計算量削減を達成しつつ、高い分類精度を維持できるか?
- RQ4バッチ活性化損失は、効率的なネットワーク構造の学習にどのように寄与するか?
主な発見
- 提案手法は、ImageNet分類においてResNetで計算量を45–52%削減し、精度の低下は最小限に抑えられた。
- MobileNetV2では、19–37%の計算量削減が達成されつつ、競争力のある精度を維持した。
- 本フレームワークは、単一の訓練パラダイム内でプルーニングと条件付き計算の両方を成功裏にサポートした。
- Gumbel再パラメータ化の使用により、微分可能なアーキテクチャ探索が可能になり、ネットワーク構造のエンドツーエンド最適化が実現された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。