Skip to main content
QUICK REVIEW

[論文レビュー] Parsimonious Inference on Convolutional Neural Networks: Learning and applying on-line kernel activation rules

Ilias Theodorakopoulos, Vasileios K. Pothos|arXiv (Cornell University)|Jan 18, 2017
Advanced Neural Network Applications参考文献 3被引用数 7
ひとこと要約

本論文は、推論中に畳み込みニューラルネットワーク(CNN)のカーネルを動的に、オンザフライでプルーニングできる、新しいデータ駆動型手法を提案する。計算負荷を著しく軽減する一方で、精度を損なわず、モバイルプラットフォーム上で最大3倍の高速化を達成する。リアルタイムで不要なフィルタを一括して無効化する学習可能な活性化ルールを導入することで、認識性能を維持または向上させつつ、推論性能を大幅に向上させる。

ABSTRACT

A new, radical CNN design approach is presented in this paper, considering the reduction of the total computational load during inference. This is achieved by a new holistic intervention on both the CNN architecture and the training procedure, which targets to the parsimonious inference by learning to exploit or remove the redundant capacity of a CNN architecture. This is accomplished, by the introduction of a new structural element that can be inserted as an add-on to any contemporary CNN architecture, whilst preserving or even improving its recognition accuracy. Our approach formulates a systematic and data-driven method for developing CNNs that are trained to eventually change size and form in real-time during inference, targeting to the smaller possible computational footprint. Results are provided for the optimal implementation on a few modern, high-end mobile computing platforms indicating a significant speed-up of up to x3 times.

研究の動機と目的

  • リソース制限のある環境(例:モバイルデバイス)におけるCNN推論の計算負荷を低減すること。
  • すべての層で同じように冗長な特徴を処理する固定で完全に活性化されたCNNの非効率性を解消すること。
  • 入力データに基づいてリアルタイムで適応的かつ動的にネットワークをプルーニングできる手法を開発すること。
  • 計算量を著しく削減しながらも、認識精度を維持または向上させること。
  • 動的アーキテクチャ調整により、低消費電力のモバイルプラットフォーム上での高精度CNNの実用的導入を可能にすること。

提案手法

  • 推論中に畳み込み層のフィルタを動的に無効化する、入力に依存する学習可能な活性化ルールを導入する。
  • 軽量なゲーティング機構を従来のCNNアーキテクチャに追加する形で統合し、元のネットワーク構造を保持する。
  • 勾配ベース最適化が可能になるように、微分可能近似を用いてゲーティング機構をCNNと同時にエンドツーエンドで学習する。
  • 推論時に学習済みの活性化ルールを適用することで、入力に応じてネットワークが「収縮」し、FLOPsとメモリアクセスを削減する。
  • スパarsityを促進し、ゲーティング機構における過学習を防ぐために構造的正則化戦略を採用する。
  • ハードスレッショルド処理の微分可能リラクゼーションを用いて、スパース推論プロセスにおける誤差逆伝搬を可能にする。

実験結果

リサーチクエスチョン

  • RQ1CNNは、入力の特徴に応じて推論中に計算負荷を動的に調整できるか?
  • RQ2精度を損なわず、リアルタイムで不要なフィルタを特定・プルーニングする方法は何か?
  • RQ3モバイルプラットフォーム上での最小限の精度損失で、最大どれだけの計算量削減が達成できるか?
  • RQ4アーキテクチャの再設計なしに、エンドツーエンドで学習可能なゲーティング機構を訓練可能か?
  • RQ5動的推論は、モバイルデプロイメントにおける推論速度とエネルギー効率にどのような影響を与えるか?

主な発見

  • 提案手法は、ハイエンドモバイルプラットフォーム上で最大3倍の高速化を達成し、トップ-1精度を維持または向上させる。
  • 推論中に顕著なフィルタプルーニングが行われても、ベンチマークデータセット上で精度を維持または向上させる。
  • 任意の既存のCNNアーキテクチャと互換性があり、軽量な追加モジュールのみを追加すればよい。
  • 学習済みの活性化ルールは入力に依存するため、入力の複雑さに応じた適応的計算が可能になる。
  • FLOPsとメモリ帯域幅の使用量が削減され、モバイルデバイスにおけるエネルギー消費が低減される。
  • 複数のネットワークアーキテクチャおよびデータセットにおいても、一貫した性能向上を示し、頑健性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。