Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Pareto Frontier for Performance Evaluation of Deep Neural Networks

Vahid Partovi Nia, Alireza Ghaffari|arXiv (Cornell University)|Feb 18, 2022
Machine Learning and Data Classification被引用数 4
ひとこと要約

本稿では、精度、推論遅延(クラウドおよびエッジハードウェアで測定)、および学習コストを同時に最適化することで、深層ニューラルネットワーク(DNN)を客観的に評価するための確率的多次元パレートフロンティアを提案する。パラメトリックブートストラップを用いてランダムな変動を組み込むことで、多様なハードウェア上でモデルの順位付けが安定化し、MobileNetV3とSqueezeNetV1.1が性能のばらつきに関わらず、常に効率性で優位であることが明らかになった。

ABSTRACT

Performance optimization of deep learning models is conducted either manually or through automatic architecture search, or a combination of both. On the other hand, their performance strongly depends on the target hardware and how successfully the models were trained. We propose to use a multi-dimensional Pareto frontier to re-define the efficiency measure of candidate deep learning models, where several variables such as training cost, inference latency, and accuracy play a relative role in defining a dominant model. Furthermore, a random version of the multi-dimensional Pareto frontier is introduced to mitigate the uncertainty of accuracy, latency, and throughput of deep learning models in different experimental setups. These two complementary methods can be combined to perform objective benchmarking of deep learning models. Our proposed method is applied to a wide range of deep image classification models trained on ImageNet data. Our method combines competing variables with stochastic nature in a single relative efficiency measure. This allows ranking deep learning models that run efficiently on different hardware, and combining inference efficiency with training efficiency objectively.

研究の動機と目的

  • 推論と学習の両方の効率性を考慮した、多変数かつ客観的な深層学習モデルのベンチマーク手法の欠如を是正すること。
  • 確率的トレーニングとハードウェア固有の遅延によるDNNの性能ばらつきを軽減するため、確率的パレートフロンティアを導入すること。
  • 精度、複数のハードウェアプラットフォームにおける遅延、および学習コストといった対立する指標を統合し、モデル比較のための単一の相対的効率指標を定義すること。
  • 多様なハードウェアターゲットにおいて、モデル選択を客観的に行えるように、モデル間の確率的優位関係を定義すること。

提案手法

  • トップ1精度、NVIDIA V100の推論遅延、ARM Kirin 970エッジデバイスの遅延に加え、米ドル単位の学習コストの3つの主要な目的を組み込んだ多次元パレートフロンティアを提案する。
  • 5回の実験走行を対象にパラメトリックブートストラップを用いて、精度、遅延、学習コストにおけるランダムな変動をモデル化する確率的パレートフロンティアを導入する。
  • モデルの全目的にわたる優位性を反映する正規化スコアとして相対的効率指標θ̂を定義し、モデル間の比較を可能にする。
  • 確率的優位性を用いてモデルを順位付けし、モデルAからモデルBへの矢印は、不確実性を考慮してもAがすべての目的でBを上回ることを示す。
  • ImageNet-1Kで学習されたモデルの実測値を用いて、効率の分布を計算し、性能のばらつきを可視化するためのボックスプロットを生成する。
  • MobileNet、ResNet、DenseNet、MNASNetなど、多様な画像分類モデルを複数のハードウェアプラットフォームで評価する。

実験結果

リサーチクエスチョン

  • RQ1異なるハードウェアプラットフォームで精度、推論遅延、学習コストのトレードオフが生じる中で、どのようにして深層学習モデルを客観的に比較できるか?
  • RQ2モデル性能(精度、遅延、学習コスト)におけるランダムなばらつきが、モデル順位付けの信頼性にどの程度影響を及えるか?
  • RQ3多目的効率指標を用いた場合、どのような深層学習モデルが多様なハードウェアおよび学習条件において一貫して優位性を示すか?
  • RQ4確率的パレートフロンティアは、深層学習モデル評価における性能の不確実性を効果的に捉え、緩和できるか?

主な発見

  • MobileNetV3とSqueezeNetV1.1は、狭いボックスプロット分布を示しており、複数回の実行および複数のハードウェアプラットフォームで安定した高い相対的効率を達成している。
  • ShuffleNetV2とMobileNetV3は強く確率的優位性を示し、性能のばらつきに対しても効率性が保たれており、効率スコアが常に100%近くに維持されている。
  • DualPathNet92は最悪の性能を示し、その効率分布は20%のしきい値を下回っており、低さと優位性の欠如が明らかになった。
  • 学習コストの組み込みにより、モデル順位付けが顕著に変化した。遅延のみを基準にするとMobileNetV3がリードするが、学習コストを考慮に入れるとShuffleNetV2がより効率的となる。
  • 図3(b)の確率的優位性図は、MobileNetV3やSqueezeNetV1.1が不確実性を考慮しても、他のすべてのモデルをすべての目的で上回っていることを確認している。
  • 本手法により、従来無視されがちな学習コストを統合し、DNNの包括的かつ客観的なベンチマークフレームワークとしての効率性の再定義に成功した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。