[論文レビュー] Jointly Optimizing Preprocessing and Inference for DNN-based Visual Analytics
この論文では、最新のアクセラレータ上でDNNベースのビジュアルアナリティクスにおける前処理と推論を共同最適化するシステムSmolを提案する。低解像度の入力データとハードウェアに配慮したパイプライン実行エンジンを活用することで、前処理をチューナブルな最適化表面として再考し、固定精度を維持したまま、先行研究と比較して最大5.9倍のエンドツーエンドスループット向上を達成した。
While deep neural networks (DNNs) are an increasingly popular way to query large corpora of data, their significant runtime remains an active area of research. As a result, researchers have proposed systems and optimizations to reduce these costs by allowing users to trade off accuracy and speed. In this work, we examine end-to-end DNN execution in visual analytics systems on modern accelerators. Through a novel measurement study, we show that the preprocessing of data (e.g., decoding, resizing) can be the bottleneck in many visual analytics systems on modern hardware. To address the bottleneck of preprocessing, we introduce two optimizations for end-to-end visual analytics systems. First, we introduce novel methods of achieving accuracy and throughput trade-offs by using natively present, low-resolution visual data. Second, we develop a runtime engine for efficient visual DNN inference. This runtime engine a) efficiently pipelines preprocessing and DNN execution for inference, b) places preprocessing operations on the CPU or GPU in a hardware- and input-aware manner, and c) efficiently manages memory and threading for high throughput execution. We implement these optimizations in a novel system, Smol, and evaluate Smol on eight visual datasets. We show that its optimizations can achieve up to 5.9x end-to-end throughput improvements at a fixed accuracy over recent work in visual analytics.
研究の動機と目的
- NVIDIA T4のような最新のアクセラレータ上で、エンドツーエンドDNN推論における前処理の増大するボトルネックを解消すること。
- 長年にわたり広く受け入れられてきたDNN実行が推論コストを支配するとする仮定に疑問を呈し、実際には前処理がしばしば主要なボトルネックであることを示すこと。
- 入力解像度と前処理の配置を最適化パラメータとして第一級のものとすることで、新たな精度-スループットトレードオフを可能にすること。
- 前処理のオーバーヘッドを考慮したコストモデルを設計し、ビジュアルアナリティクスシステムにおけるクエリプラン選択を改善すること。
- CPUとGPU間で前処理とDNN実行を効率的にパイプライン化するランタイムエンジンを設計し、メモリとスレッドリソースを最適化すること。
提案手法
- 前処理とDNN実行時間の両方を考慮することで、エンドツーエンド推論コストを推定する前処理に配慮したコストモデルを導入する。
- ネイティブに利用可能な低解像度のビジュアルデータ(例:サムネイル、部分的デコード)を活用し、DNNトレーニングを拡張することで前処理コストを低減しながら精度を維持する。
- ハードウェア仕様と入力データに応じて、前処理オペレーションをCPUまたはGPUに動的に配置するランタイムエンジンを設計する。
- 前処理とDNN推論のオーバーラップを実現するパイプライン実行モデルを採用し、レイテンシを隠蔽してスループットを向上させる。
- 効率的なメモリ管理とスレッドスケジューリングを実装し、現代のCPUとGPUリソースを最大限に活用する。
- これらの最適化を統合した、ビジュアルアナリティクス向けのエンドツーエンド推論エンジンとして、システムSmolを実装する。
実験結果
リサーチクエスチョン
- RQ1最新の推論最適化アクセラレータ(例:g4dn.xlarge)上で、エンドツーエンドDNN推論において、DNN実行よりも前処理が主要なボトルネックとなっているか?
- RQ2低解像度または部分的にデコードされた入力データを用いることで、精度を損なわずにスループットを顕著に向上させられるか?
- RQ3ハードウェアに配慮したタスク配置とパイプライン処理を通じて、前処理とDNN実行をどのように共同最適化できるか?
- RQ4従来のDNN専用コストモデルと比較して、前処理に配慮したコストモデルは、ビジュアルアナリティクスシステムにおけるクエリプラン選択をどれほど改善できるか?
- RQ5実世界のビジュアルアナリティクスワークロードにおいて、前処理と推論の共同最適化がエンドツーエンドレイテンシをどれほど短縮し、スループットをどれほど向上させられるか?
主な発見
- T4 GPUを搭載した推論最適化型g4dn.xlarge AWSインスタンスでは、ResNet-50のケースで前処理コストがDNN実行コストの9倍に達し、主なボトルネックとなっている。
- 同じインスタンス上では、前処理はDNN実行に比べて約2.3倍の電力消費量を要し、コストは11倍に達しており、前処理を無視した場合のエネルギーおよびコスト非効率性が顕著に示された。
- 8つのビジュアルデータセットを対象に、固定精度を維持したまま、最近のビジュアルアナリティクスシステムと比較して最大5.9倍のエンドツーエンドスループット向上を達成した。
- 低解像度データの使用に加え、拡張されたDNNトレーニングを適用することで、精度を回復させつつ前処理コストを低減でき、新たな精度-スループットトレードオフを実現した。
- 提案された前処理に配慮したコストモデルは、従来のモデルよりも正確であり、DNN実行が推論時間の主因であると誤って仮定していた過去のモデルとは対照的であった。
- ランタイムエンジンの動的CPU/GPU配置とパイプライン処理により、異種ハードウェア間でメモリとスレッドを効率的に管理することで、高いスループットが達成された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。