Skip to main content
QUICK REVIEW

[論文レビュー] MLModelScope: A Distributed Platform for Model Evaluation and Benchmarking at Scale

Abdul Dakkak, Cheng Li|arXiv (Cornell University)|Feb 19, 2020
Machine Learning in Materials Science被引用数 5
ひとこと要約

MLModelScopeは、標準化された仕様と拡張可能なランタイムを通じて、スケーラブルで再現可能かつ公平なモデル評価およびベンチマークを可能にする分散型でフレームワークおよびハードウェアに依存しないプラットフォームです。異なるハードウェアとソフトウェアスタック across で並列評価をサポートし、レイヤーおよびライブラリレベルでのパフォーマンスボトルネックを特定するインテロスペクション機能を備え、同じモデルとハードウェア上でTensorRTとCaffe2の間で顕著なパフォーマンス差が生じることを示しています。

ABSTRACT

Machine Learning (ML) and Deep Learning (DL) innovations are being introduced at such a rapid pace that researchers are hard-pressed to analyze and study them. The complicated procedures for evaluating innovations, along with the lack of standard and efficient ways of specifying and provisioning ML/DL evaluation, is a major "pain point" for the community. This paper proposes MLModelScope, an open-source, framework/hardware agnostic, extensible and customizable design that enables repeatable, fair, and scalable model evaluation and benchmarking. We implement the distributed design with support for all major frameworks and hardware, and equip it with web, command-line, and library interfaces. To demonstrate MLModelScope's capabilities we perform parallel evaluation and show how subtle changes to model evaluation pipeline affects the accuracy and HW/SW stack choices affect performance.

研究の動機と目的

  • 急速に進化するML/DLモデル、フレームワーク、ハードウェアスタックの評価を再現可能で公平に行うという増大する課題に対処すること。
  • 仕様とハードウェア/ソフトウェアのプロビジョニングを分離することで、モデル評価に要する複雑さと時間を低減すること。
  • 再現可能なベンチマークを多様なMLフレームワークとアクセラレータでサポートする、標準的で拡張可能かつカスタマイズ可能なプラットフォームを提供すること。
  • モデル実行の細粒度のインテロスペクションを可能にし、レイヤーおよびライブラリレベルでのパフォーマンスボトルネックを特定すること。
  • 一貫性のあるレポートと再現性の保証を伴う大規模かつ並列な評価をサポートすること。

提案手法

  • プラットフォームは、モデルパイプラインの段階(前処理、推論、後処理)を下位のHW/SWスタックから分離するテキストベースのモデル評価仕様を使用している。
  • 分散ランタイムシステムは、この仕様とユーザー定義のハードウェア制約を消費し、異種環境 across で評価をプロビジョニングおよび実行する。
  • このシステムは、PyTorch、TensorFlow、Caffe2、TensorRT などの複数のMLフレームワークおよび x86、ARM、Power、CPU、GPU、FPGA などのハードウェアプラットフォームをサポートする。
  • 使いやすさと統合の容易さを実現するため、コマンドライン、ライブラリ、Web UI の3つのアクセスインターフェースを提供する。
  • レイヤーおよびライブラリレベルでのレイテンシとメモリ使用量をキャプチャするプロファイラーを備え、パフォーマンスインテロスペクションを可能にする。
  • 評価結果は一貫して報告され、モデル、フレームワーク、ハードウェア構成の間での公平な比較を可能にする。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、多様なハードウェアおよびソフトウェアスタック across でスケーラブルで再現可能かつ公平なモデル評価を実現できるか?
  • RQ2同じハードウェア上で、フレームワークの実装の違いがモデル推論パフォーマンスにどの程度影響を及えるか?
  • RQ3統一された仕様とランタイムシステムは、大規模なモデルベンチマークの時間と複雑さを低減できるか?
  • RQ4ハードウェアおよびソフトウェアスタックの選択が、レイヤーおよびライブラリレベルでのモデルの正確性とパフォーマンスにどのように影響するか?
  • RQ5異なるフレームワーク across で、モデルの部分粒度での実行をインテロスペクションすることで、どのようなインサイトが得られるか?

主な発見

  • MLModelScopeは、多様なハードウェアおよびソフトウェアスタック across で、一貫性があり再現可能な結果を得る並列でスケーラブルなモデル評価を可能にする。
  • 同じハードウェア(Amazon p3.2xlarge)上で、TensorRTは最初のconv2とReLUレイヤーを1つのカーネルに統合し、1.95msで実行したが、Caffe2はそれらを統合せず、より長い2.63msの実行時間となった。
  • プラットフォームのインテロスペクション機能により、異なるフレームワークが同じモデルレイヤーを異なるライブラリ関数で実装していることが判明し、測定可能なパフォーマンス差が生じていることが明らかになった。
  • MLModelScopeは、MLPerf Inference や AI-Matrix などのベンチマークスイートからのモデルを正常に統合し、分散評価およびプロファイリングでの利用を可能にした。
  • 前処理操作などのモデル評価パイプライン内のわずかな変更が、最終的な正確性およびパフォーマンス結果に影響を与えることがあることが示された。
  • 仕様と実行を分離することで、MLModelScopeはモデル評価者によるテストまでの時間を短縮し、モデルやスタック across で一貫性があり公平な比較をサポートする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。