Skip to main content
QUICK REVIEW

[論文レビュー] Neural Architecture Design for GPU-Efficient Networks

Ming Lin, Hesen Chen|arXiv (Cornell University)|Jun 24, 2020
Advanced Neural Network Applications参考文献 23被引用数 11
ひとこと要約

本論文は、現代のGPUハードウェアの特長を活かすために、低レベルの層ではフル畳み込みを、高レベルの層では深度方向/ボトルネック畳み込みを用いるGPU効率の良いニューラルアーキテクチャ設計原則を提案する。軽量なNAS手法(LLR-NAS)を用いて、GENets—効率的で高精度なモデル—を設計した。これらのモデルは、最新のGPU上でEfficientNet-B3と比較して最大6.4倍高速な推論を達成し、ImageNetではトップ-1精度が81.3%以上を維持している。

ABSTRACT

Many mission-critical systems are based on GPU for inference. It requires not only high recognition accuracy but also low latency in responding time. Although many studies are devoted to optimizing the structure of deep models for efficient inference, most of them do not leverage the architecture of extbf{modern GPU} for fast inference, leading to suboptimal performance. To address this issue, we propose a general principle for designing GPU-efficient networks based on extensive empirical studies. This design principle enables us to search for GPU-efficient network structures effectively by a simple and lightweight method as opposed to most Neural Architecture Search (NAS) methods that are complicated and computationally expensive. Based on the proposed framework, we design a family of GPU-Efficient Networks, or GENets in short. We did extensive evaluations on multiple GPU platforms and inference engines. While achieving $\geq 81.3\%$ top-1 accuracy on ImageNet, GENet is up to $6.4$ times faster than EfficienNet on GPU. It also outperforms most state-of-the-art models that are more efficient than EfficientNet in high precision regimes. Our source code and pre-trained models are available from \url{https://github.com/idstcv/GPU-Efficient-Networks}.

研究の動機と目的

  • 現代のGPU上で既存の効率的ネットワークの推論性能が最適でない問題に取り組むこと。これは、しばしばGPU固有のハードウェア特性を無視している。
  • 現代のGPUハードウェアに特化した最適化を図るニューラルネットワークアーキテクチャの設計原則を特定・形式化すること。主な焦点は遅延とスループットである。
  • 簡略化され、ハードウェアに配慮した設計空間内で、計算コストの高いNAS手法に依存せずに、GPU効率の良いアーキテクチャを効率的に探索できる軽量NAS手法(LLR-NAS)を開発すること。
  • 複数のGPUプラットフォームおよび推論エンジンで、速度と精度の両面で最先端のモデルを上回る、高精度で低遅延なネットワーク(GENets)のファミリーを構築すること。

提案手法

  • 実測プロファイルに基づき、カーネルの特異値と遅延を分析し、低レベル段階ではフル畳み込み、高レベル段階では深度方向/ボトルネック畳み込みを組み合わせたGPU最適化設計空間を提案する。
  • 局所線形回帰NAS(LLR-NAS)を用いる。これは初期アーキテクチャを摂動し、各バリエーションを30エポック分だけ訓練することで、精度と遅延を予測する軽量NASアルゴリズムである。
  • 特定のブロックタイプに応じた範囲内で、カーネルサイズ(3,5)、チャネル幅(2.0cから0.5c)、深さ(ベースから±2)、ボトルネック比(r)といった重要なハイパーパrameterを調整する。
  • データオーギュメンテーション(mix-up, random-erase, auto-augmentation)、ラベルスムージング、およびResNet-152の教師から蒸留することにより、最終的なGENetモデルを480エポック分訓練する。
  • 標準的なImageNetスプリットを用いて、3つの設定(V100(FP16, PyTorch)、T4(FP16, TensorRT)、T4(INT8, TensorRT))で推論速度をベンチマークする。
  • T4 GPU上で混合精度推論を最大化するために、TensorRTの組み込みINT8キャリブレーションを適用する。

実験結果

リサーチクエスチョン

  • RQ1異なるネットワークの深さにおいて、現代のGPU上でフル畳み込み、深度方向畳み込み、ボトルネック畳み込みといった異なる畳み込み演算子の遅延性能はどのように異なるか?
  • RQ2簡略化され、ハードウェアに配慮した設計空間は、計算コストの高いNAS手法に依存せずに、効果的かつ効率的なニューラルアーキテクチャ探索を可能にするか?
  • RQ3原則に基づいた設計空間に従って、軽量NAS手法(LLR-NAS)が、高性能でGPU最適化されたアーキテクチャをどの程度効果的に発見できるか?
  • RQ4GENetsは、EfficientNet や OFANet といった最先端のモデルと比較して、多様なGPUプラットフォームおよび推論エンジンで、精度と推論速度の両面で優れているか?
  • RQ5初期層にフル畳み込み、後続層に深度方向/ボトルネック畳み込みを組み合わせたハイブリッド畳み込み演算子を用いたネットワークは、均一な演算子を使用するモデルと比較して、より優れたGPU効率を達成するか?

主な発見

  • GENet-largeは、T4 + TensorRT + INT8推論設定下で、EfficientNet-B3と比較して6.4倍高速であり、ImageNetではトップ-1精度が81.3%を達成している。
  • GENet-normalは、EfficientNet-B2と比較して6.8倍高速であり、80.0%の精度レベルでOFANetと比較して4.2倍高速である。これは、高精度領域における優れた効率性を示している。
  • V100(FP16, PyTorch)環境下で、同じ推論速度においてGENet-largeはEfficientNet-B0と比較して5.0%高い精度を達成しており、精度-遅延の優位性が顕著に表れている。
  • 低レベル段階ではフル畳み込み、高レベル段階では深度方向/ボトルネック畳み込みを用いるという設計原則は、顕著なGPU利用効率の向上と遅延の低減をもたらしている。
  • GENetsは優れた転送性を示しており、V100やT4といった異なるGPUプラットフォームおよびPyTorchやTensorRTといった異なる推論エンジンでも、性能向上が一貫して得られている。
  • 軽量なLLR-NAS手法と、原則に基づいた設計空間を組み合わせることで、24台のV100を用いて約60 GPU時間で効率的なアーキテクチャ探索が可能となり、ブルートフォースNASの計算コストを回避できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。