Skip to main content
QUICK REVIEW

[論文レビュー] InferBench: Understanding Deep Learning Inference Serving with an Automatic Benchmarking System

Huaizheng Zhang, Yizheng Huang|arXiv (Cornell University)|Nov 4, 2020
Adversarial Robustness in Machine Learning参考文献 26被引用数 6
ひとこと要約

InferBench は、ワークロード生成、モデルの変種、パフォーマンス分析を自動化することで、ディープラーニング推論サービングの評価を簡素化する分散型の自動ベンチマーキングシステムです。2段階スケジューラーを採用することで、平均ジョブ完了時間を 30% 短縮(1.43倍の高速化)を達成し、ハードウェア、ソフトウェア、パイプライン構成のあらゆる側面における遅延、コスト、リソースのトレードオフに関する実用的なガイドラインを提供します。

ABSTRACT

Deep learning (DL) models have become core modules for many applications. However, deploying these models without careful performance benchmarking that considers both hardware and software's impact often leads to poor service and costly operational expenditure. To facilitate DL models' deployment, we implement an automatic and comprehensive benchmark system for DL developers. To accomplish benchmark-related tasks, the developers only need to prepare a configuration file consisting of a few lines of code. Our system, deployed to a leader server in DL clusters, will dispatch users' benchmark jobs to follower workers. Next, the corresponding requests, workload, and even models can be generated automatically by the system to conduct DL serving benchmarks. Finally, developers can leverage many analysis tools and models in our system to gain insights into the trade-offs of different system configurations. In addition, a two-tier scheduler is incorporated to avoid unnecessary interference and improve average job compilation time by up to 1.43x (equivalent of 30\% reduction). Our system design follows the best practice in DL clusters operations to expedite day-to-day DL service evaluation efforts by the developers. We conduct many benchmark experiments to provide in-depth and comprehensive evaluations. We believe these results are of great values as guidelines for DL service configuration and resource allocation.

研究の動機と目的

  • MLPerf などの既存のディープラーニング推論ベンチマーキングシステムにおける設定の自由度の低さと自動化の不足を解消すること。
  • プロダクション環境でディープラーニングモデルをデプロイする開発者が直面する手作業による作業とエラーのリスクを低減すること。
  • ハードウェア、ソフトウェア、推論パイプライン構成のあらゆる側面における設計空間の包括的探索を可能にすること。
  • 現実世界の制約下でのサービス設定とリソース割り当てに役立つ、データドリブンな実用的ガイドラインを提供すること。
  • 2段階スケジューラーを導入することで、システム効率を向上させ、平均ジョブ完了時間を 30% 短縮すること。

提案手法

  • 開発者が設定ファイルのみを提出するディープラーニングクラスタに自動ベンチマーキングシステムをデプロイする。
  • ハイパーパrameter(例:レイヤー数、種別)を変化させた多様なモデルを自動生成し、設計空間を探索する。
  • リーダーフォロワー型アーキテクチャを採用し、リーダーがタスクをワーカーノードに割り当てる形でベンチマーキングジョブを分散処理する。
  • キューを考慮したロードバランシングと Short-Job-First (SJF) を組み合わせた2段階スケジューラーを実装し、ジョブ完了時間を最小限に抑える。
  • 標準化されたメトリクス(末尾遅延、クラウドコスト、リソース使用率)と分析モデル(Roofline、ヒートマップ)を用いてパフォーマンスプロファイリングを行う。
  • 3 種類のネットワーキング技術(例:4G LTE)を用いて、実世界の推論パイプラインをシミュレートし、エンドツーエンドの遅延と伝送影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1どのようにしてディープラーニング推論ベンチマーキングを自動化し、開発者の作業負荷とエラー率を低減できるか?
  • RQ2ハードウェアプラットフォーム、サービングソフトウェア、ネットワーク状態の違いが、推論パフォーマンスとコストに与える影響は何か?
  • RQ3バッチサイズやモデルの深さといったハイパーパrameter が、遅延、スループット、リソース使用率に与える影響は何か?
  • RQ42段階スケジューラーは、分散ベンチマーキング環境において、ジョブ完了時間を顕著に改善できるか?
  • RQ5現実世界のディープラーニングサービングデプロイにおいて、遅延、コスト、リソース使用率の主なトレードオフは何か?

主な発見

  • キューを考慮したロードバランシングと SJF を組み合わせた2段階スケジューラーにより、平均ジョブ完了時間が 1.43 倍(30% の改善)に短縮された。
  • 小規模バッチサイズでは伝送時間と推論時間が同等の水準に達したが、バッチサイズが増加するにつれて推論時間が支配的になった。
  • 4G LTE は最も高いエンドツーエンド遅延を示し、モバイル推論ワークロードにおける顕著なネットワークオーバーヘッドを示した。
  • ResNet50 のような小規模モデルではコールドスタート時間が 10 秒を超えたため、リソースプロビジョニングに課題が生じた。
  • GPU 利用率は、サービングソフトウェアによって顕著に変動し、TFS が TrIS よりも安定性と効率性の面で優れていた。
  • 本システムにより、ハードウェア、ソフトウェア、パイプラインの3段階にわたり包括的な分析が可能となり、設定と最適化に役立つ実用的インサイトを提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。