Skip to main content
QUICK REVIEW

[論文レビュー] Latency-aware Spatial-wise Dynamic Networks

Yizeng Han, Zhihang Yuan|arXiv (Cornell University)|Oct 12, 2022
Advanced Neural Network Applications被引用数 11
ひとこと要約

本稿では、粗粒度の空間的適応推論とハードウェアに配慮した遅延予測子を共同で設計することで、実用的な推論効率を向上させる遅延に配慮した空間的動的ネットワーク、LASNetを提案する。マルチコアGPU向けにアルゴリズム設計とスケジューリング戦略を最適化することで、ResNet-101の推論遅延をNVIDIA Tesla V100で36%、Jetson TX2で46%削減し、精度の損失なしに実現した。

ABSTRACT

Spatial-wise dynamic convolution has become a promising approach to improving the inference efficiency of deep networks. By allocating more computation to the most informative pixels, such an adaptive inference paradigm reduces the spatial redundancy in image features and saves a considerable amount of unnecessary computation. However, the theoretical efficiency achieved by previous methods can hardly translate into a realistic speedup, especially on the multi-core processors (e.g. GPUs). The key challenge is that the existing literature has only focused on designing algorithms with minimal computation, ignoring the fact that the practical latency can also be influenced by scheduling strategies and hardware properties. To bridge the gap between theoretical computation and practical efficiency, we propose a latency-aware spatial-wise dynamic network (LASNet), which performs coarse-grained spatially adaptive inference under the guidance of a novel latency prediction model. The latency prediction model can efficiently estimate the inference latency of dynamic networks by simultaneously considering algorithms, scheduling strategies, and hardware properties. We use the latency predictor to guide both the algorithm design and the scheduling optimization on various hardware platforms. Experiments on image classification, object detection and instance segmentation demonstrate that the proposed framework significantly improves the practical inference efficiency of deep networks. For example, the average latency of a ResNet-101 on the ImageNet validation set could be reduced by 36% and 46% on a server GPU (Nvidia Tesla-V100) and an edge device (Nvidia Jetson TX2 GPU) respectively without sacrificing the accuracy. Code is available at https://github.com/LeapLabTHU/LASNet.

研究の動機と目的

  • 空間的動的ネットワークにおける理論的FLOPsと実際の推論遅延のギャップを解消すること。
  • GPUのようなマルチコアプロセッサ上で、非連続メモリアクセスと最適でないスケジューリングによる、細粒度のピクセル単位の適応推論の非効率性を克服すること。
  • 多様なハードウェアプラットフォームと深層学習タスクにわたる実世界の高速化を可能にする汎用性のあるフレームワークを開発すること。
  • アルゴリズム設計とスケジューリング設計に遅延予測を統合し、動的ネットワークの効率的デプロイメントを支援すること。
  • 画像分類、物体検出、インスタンスセグメンテーションのベンチマークにおいて、モデルの精度を維持したまま顕著な実用的高速化を達成すること。

提案手法

  • アルゴリズム設計、スケジューリング戦略、ハードウェア特性を統合的に考慮することで、推論遅延を共同で推定する遅延予測モデルを提案する。
  • ピクセル単位ではなく、特徴マップのパッチ単位で計算を割り当てる粗粒度の空間的適応推論を導入し、メモリアクセスの連続性を向上させる。
  • 入力コンテンツに応じて、どの特徴パッチの計算が必要かを予測するトレーニング可能なマスクモジュールを設計する。
  • 動的演算子のスケジューリングとカーネル実装を最適化し、GPUの並列処理能力とメモリ階層をより効果的に活用する。
  • トレーニング中に遅延予測子を活用し、ターゲットハードウェアに最適な計算パターンを学習できるようにネットワークをガイドする。
  • 広範な適用性を実現するため、さまざまなCNNバックボーン(例:ResNet、DenseNet、RegNet)にフレームワークを統合する。

実験結果

リサーチクエスチョン

  • RQ1なぜGPU上での空間的動的ネットワークにおいて、理論的FLOPsは実際の推論遅延を予測できないのか?
  • RQ2空間的適応推論の粒度(ピクセル単位対パッチ単位)が、マルチコアプロセッサ上での実用的遅延にどのように影響するのか?
  • RQ3ハードウェアに配慮した遅延予測子は、異なるデバイス間で効果的に効率的な動的ネットワークの設計を支援できるか?
  • RQ4粗粒度の空間的適応は、モデルの精度を損なわずに、実用的な推論速度をどの程度向上できるか?
  • RQ5提案されたフレームワークは、さまざまな深層学習タスクとバックボーンアーキテクチャに一般化可能か?

主な発見

  • LASNetは、ImageNet上でNVIDIA Tesla V100でResNet-101の推論遅延を36%削減し、NVIDIA Jetson TX2でも46%削減し、精度の低下なしに実現した。
  • COCO物体検出タスクにおいて、トレーニングターゲットを0.4に設定したLAS-ResNet-101は、Faster R-CNNで40.0% mAP、RetinaNetで39.3% mAPを達成し、静的ベースラインと比較して25–30%の遅延低減を実現した。
  • インスタンスセグメンテーションにおいて、トレーニングターゲットを0.5に設定したLAS-ResNet-101は、ベースラインと比較してAP^maskを0.9%、AP^boxを1.0%向上させながらも、より高速な推論を維持した。
  • 遅延予測子により、サーバー用GPUからエッジGPUまで多様なハードウェアで正確な遅延推定が可能となり、ハードウェアに配慮したモデル設計を促進した。
  • 粗粒度の空間的適応は、細粒度のピクセル単位の意思決定に比べ、メモリアクセスパターンを著しく改善し、GPUの並列処理能力をより効果的に活用できるようになった。
  • フレームワークは汎用的である:画像分類、物体検出、インスタンスセグメンテーションなど、さまざまなバックボーンとタスクに適用可能であり、一貫した効率向上を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。