Skip to main content
QUICK REVIEW

[論文レビュー] Parity Models: A General Framework for Coding-Based Resilience in ML Inference

Jack Kosaian, K. V. Rashmi|arXiv (Cornell University)|May 2, 2019
Machine Learning and Data Classification参考文献 84被引用数 11
ひとこと要約

ParMは、神経ネットワークベースのパリティモデルを用いる一般化されたフレームワークを導入し、機械学習推論システムにおけるコード化ベースのレジliエンスを実現することで、遅延や障害発生時における利用不能な予測の高速再構成を可能にする。リソース同等の手法と比較して、尾遅延(tail latency)を最大3.5倍短縮する一方、レプリケーションと比較して2–4倍のリソースオーバーヘッドを削減する。

ABSTRACT

Machine learning models are becoming the primary workhorses for many applications. Production services deploy models through prediction serving systems that take in queries and return predictions by performing inference on machine learning models. In order to scale to high query rates, prediction serving systems are run on many machines in cluster settings, and thus are prone to slowdowns and failures that inflate tail latency and cause violations of strict latency targets. Current approaches to reducing tail latency are inadequate for the latency targets of prediction serving, incur high resource overhead, or are inapplicable to the computations performed during inference. We present ParM, a novel, general framework for making use of ideas from erasure coding and machine learning to achieve low-latency, resource-efficient resilience to slowdowns and failures in prediction serving systems. ParM encodes multiple queries together into a single parity query and performs inference on the parity query using a parity model. A decoder uses the output of a parity model to reconstruct approximations of unavailable predictions. ParM uses neural networks to learn parity models that enable simple, fast encoders and decoders to reconstruct unavailable predictions for a variety of inference tasks such as image classification, speech recognition, and object localization. We build ParM atop an open-source prediction serving system and through extensive evaluation show that ParM improves overall accuracy in the face of unavailability with low latency while using 2-4$ imes$ less additional resources than replication-based approaches. ParM reduces the gap between 99.9th percentile and median latency by up to $3.5 imes$ compared to approaches that use an equal amount of resources, while maintaining the same median.

研究の動機と目的

  • 分散クラスタ内の遅延や障害による生産環境の予測サービングシステムにおける高い尾遅延の課題に対処すること。
  • レプリケーション(高いリソースコスト)や非一般化可能なコード化計算手法(遅延オーバーヘッド、または推論に不適切)といった既存手法の制限を克服すること。
  • 画像分類、音声認識、オブジェクト検出など、多様な機械学習推論タスクに適した低遅延・リソース効率の良いレジリエンスを実現する汎用フレームワークを設計すること。
  • タスク固有の符号化と復号化を可能にする新しいコンponentとしてパリティモデルを導入し、レジリエントな推論のための高速でタスクに特化したクエリの符号化・復号化を実現すること。
  • 障害や遅延の原因にかかわらず一般化可能でありながら、障害発生時や遅延発生時でも高い予測精度を維持するレジリエンスを実現すること。

提案手法

  • 学習可能なエンコーダーを用いて複数の入力クエリを1つのパリティクエリに符号化し、パリティモデル上で統合推論を可能にする。
  • パラメータを学習可能なニューラルネットワークベースのパリティモデルを訓練し、パリティクエリを個々の予測の再構成が可能な表現にマップする。
  • パリティモデルの出力を用いて、利用不能となった予測の近似値を復号ネットワークで再構成する。
  • 画像分類向けに連結ベースの設計など、タスク固有のエンコーダーとデコーダーを設計することで、パフォーマンスを最適化し、帯域幅のオーバーヘッドを低減する。
  • 実世界のパフォーマンスと遅延特性を評価するため、オープンソースの予測サービングシステムにParMを統合する。
  • エラージャーコーディングの原則(k個の正常なユニットが、合計k+r個のユニットから元のデータを再構成可能)を、学習可能なモデルを介して推論ワークロードに適応させる。

実験結果

リサーチクエスチョン

  • RQ1一般化可能なフレームワークを設計することで、機械学習推論システムにおける低遅延かつリソース効率の良いコード化ベースのレジリエンスを実現できるか?
  • RQ2ニューラルネットワークを用いて、遅延や障害発生時における予測の高速かつ正確な再構成を可能にするパリティモデルを学習できるか?
  • RQ3ParMは、リソースをより少なく使用しながら、レプリケーションや他のコード化計算手法と比較して、尾遅延をどの程度短縮できるか?
  • RQ4ParMは、画像分類、音声認識、オブジェクト検出などの多様な推論タスクにおいて、どの程度の性能を示すか?
  • RQ5ParMは、予測精度を意図的に低下させることなく、中央値遅延を維持しつつ、99.9パーセンタイル遅延のギャップを顕著に短縮できるか?

主な発見

  • ParMは、リソース同等の手法と比較して、99.9パーセンタイル遅延と中央値遅延のギャップを最大3.5倍短縮するが、中央値遅延は同じままである。
  • ParMは、同程度のレジリエンスを実現するにあたり、レプリケーションベースの手法と比較して2–4倍の追加リソースオーバーヘッドを削減する。
  • 障害発生時や遅延発生時における予測精度の全体的な向上を実現しており、失敗したまたは遅延が生じた予測の高速再構成を可能にする。
  • ParMのアプローチは、k個のクエリに対して1/kのネットワーク帯域幅オーバーヘッドに留まるが、画像連結手法(例:Narra et al. 2019)ではk倍のオーバーヘッドを要する。
  • 学習可能なエンコーダーとデコーダーのおかげで、障害が発生しない通常時でも遅延を追加せずに、高速で低遅延の再構成が可能である。
  • 画像分類、音声認識、オブジェクト検出など、多様な推論タスクに一般化可能であり、タスク固有の最適化により性能が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。