Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Rank Selection for High-Speed Convolutional Neural Network

Hyeji Kim, Chong‐Min Kyung|arXiv (Cornell University)|Jun 28, 2018
Advanced Neural Network Applications参考文献 12被引用数 4
ひとこと要約

本稿では、低ランク分解を用いた畳み込みニューラルネットワークの高速化のため、モデル単位のランク選択アルゴリズムを提案する。線形近似された精度関数と空間制約パラメータを用いて、最適なランク集合を効率的に探索する。この手法により、VGG-16で90.0%のトップ-5精度を維持したまま4.03倍の高速化を達成し、推論時間および学習時間において最先端の手法を上回る性能を発揮する。

ABSTRACT

Low-rank decomposition plays a central role in accelerating convolutional neural network (CNN), and the rank of decomposed kernel-tensor is a key parameter that determines the complexity and accuracy of a neural network. In this paper, we define rank selection as a combinatorial optimization problem and propose a methodology to minimize network complexity while maintaining the desired accuracy. Combinatorial optimization is not feasible due to search space limitations. To restrict the search space and obtain the optimal rank, we define the space constraint parameters with a boundary condition. We also propose a linearly-approximated accuracy function to predict the fine-tuned accuracy of the optimized CNN model during the cost reduction. Experimental results on AlexNet and VGG-16 show that the proposed rank selection algorithm satisfies the accuracy constraint. Our method combined with truncated-SVD outperforms state-of-the-art methods in terms of inference and training time at almost the same accuracy.

研究の動機と目的

  • 畳み込みニューラルネットワークの高速化において、層単位のランク選択がしばしば局所最適解に陥ることに起因する非効率性を解消すること。
  • 全層にわたる最適なランク選択のための計算探索空間を、ターゲット精度を維持しつつ縮小すること。
  • 完全な微調整を実施せずに、微調整後の性能を予測することができる精度関数の開発。
  • リソース制約のあるデバイスにおけるCNNの効率的かつ高速なデプロイメントを実現するため、最適な低ランク分解を可能にすること。

提案手法

  • 精度と複雑さの制約のもとで、ランク選択を組み合わせ最適化問題として定式化する。
  • 探索空間を妥当なランク組み合わせに制限するため、境界条件を伴う空間制約パラメータを導入する。
  • 微調整前の精度と微調整後の性能の相関関係を捉えることで、最適化をガイドする線形近似精度関数を採用する。
  • 層単位のグリーディ手法で一般的に生じる局所最適解を回避するため、全層のランクを同時に更新するモデル単位の探索戦略を採用する。
  • 低ランク分解に特徴値分解(SVD)を用い、精度とコストの制約に基づいて反復的に最良のランク集合を選択する。
  • 低コストモデルでの微調整実験から導出された精度の閾値に基づく終了条件を適用する。

実験結果

リサーチクエスチョン

  • RQ1モデル単位のランク選択戦略は、層単位のグリーディ手法に比べ、グローバルに最適なランク設定を効果的に見つけられるか?
  • RQ2低ランクCNNにおいて、微調整前のテスト精度が、最終的な微調整後精度をどの程度正確に予測できるか?
  • RQ3最適性を損なわずにランク選択の探索空間を縮小するために必要な制約は何か?
  • RQ4提案手法は、最先端の手法と比較して、推論時間および学習時間を短縮しつつ高い精度を維持できるか?

主な発見

  • 提案手法は、VGG-16で90.0%のトップ-5精度を維持したまま4.03倍の高速化を達成し、推論時間および学習時間において先行手法を上回った。
  • モデル単位の探索戦略により、局所最適解を効果的に回避し、層単位の手法よりも優れた全体的なランク設定が得られた。
  • 微調整前の精度の線形近似により、完全な微調整を実施せずに最終的な性能を正確に予測可能となった。
  • VGG-16のカーネル層数を最適なランク選択により37層から29層に削減し、推論速度の向上に寄与した。
  • GPU環境では、前方伝搬時間が8.39ms(ベースライン比2.82倍高速)であり、逆伝搬時間が12.11ms(1.49倍高速)であった。
  • 計算コストを顕著に削減しながらも、元の精度にほぼ近い水準(トップ-5で89.9%)を維持した。これにより、優れたトレードオフ効率が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。