Skip to main content
QUICK REVIEW

[論文レビュー] Collage Inference: Using Coded Redundancy for Low Variance Distributed Image Classification

Krishna Giri Narra, Zhifeng Lin|arXiv (Cornell University)|Apr 27, 2019
Advanced Neural Network Applications参考文献 42被引用数 4
ひとこと要約

本稿では、分散画像分類における尾遅延を低減するために、1回の推論パスで複数の画像を同時に分類できるカスタム畳み込みニューラルネットワーク(コラージュ-CNN)を用いた符号化冗長性技術「コラージュ推論」を提案する。複数のリクエストを集団として扱い、低コストのマルチイメージ分類器をバックアップとして用いることで、リプリケーションと比較して99百分位の遅延を1.2倍から2倍、分散を1.8倍から15倍まで低減し、高い精度を維持する。

ABSTRACT

MLaaS (ML-as-a-Service) offerings by cloud computing platforms are becoming increasingly popular. Hosting pre-trained machine learning models in the cloud enables elastic scalability as the demand grows. But providing low latency and reducing the latency variance is a key requirement. Variance is harder to control in a cloud deployment due to uncertainties in resource allocations across many virtual instances. We propose the collage inference technique which uses a novel convolutional neural network model, collage-cnn, to provide low-cost redundancy. A collage-cnn model takes a collage image formed by combining multiple images and performs multi-image classification in one shot, albeit at slightly lower accuracy. We augment a collection of traditional single image classifier models with a single collage-cnn classifier which acts as their low-cost redundant backup. Collage-cnn provides backup classification results if any single image classification requests experience slowdown. Deploying the collage-cnn models in the cloud, we demonstrate that the 99th percentile tail latency of inference can be reduced by 1.2x to 2x compared to replication based approaches while providing high accuracy. Variation in inference latency can be reduced by 1.8x to 15x.

研究の動機と目的

  • リソース競合や遅延リクエストの影響によるクラウドベース分散画像分類における高尾遅延と分散の低減。
  • MLaaS環境におけるリクエストリプリケーションの高コストを回避する低コストでスケーラブルな冗長性メカニズムの設計。
  • 予備システムとして使用可能な、最小限の精度損失でマルチ画像分類が可能な専用CNNアーキテクチャ(コラージュ-CNN)の開発。
  • 実際のクラウド環境での展開において、予測精度を損なわず推論遅延と分散を低減するコラージュ推論の有効性の評価。

提案手法

  • コラージュ-CNNモデルは、複数の入力画像を空間的に結合して1つのマルチオブジェクト入力として組み合わせたコラージュ画像を処理し、同時に分類する。
  • 1つのコラージュ-CNNが複数の個別画像分類器(s-CNNモデル)の符号化冗長バックアップとして機能し、個々のリクエストが遅延した場合のフォールバック予測を提供する。
  • 負荷分散装置が複数の推論リクエストを集団としてグループ化できる能力を活用し、効率的なバッチ処理と最小限の追加コストでの冗長性を実現する。
  • コラージュ-CNNのトレーニングデータは、データ拡張と知識蒸留技術を用いて生成され、性能向上のためs-CNN(ResNet-34)を教師モデルとして使用する。
  • 標準のパリティモデルが同様のフレームワーク(例:ParM)で使用されるのと比較し、マルチオブジェクト分類に最適化されたアーキテクチャにより、高い精度を達成している。
  • 実際のクラウド環境に展開し、リプリケーション手法と比較して遅延と分散を評価する。

実験結果

リサーチクエスチョン

  • RQ11つのマルチイメージ分類器を低コストのバックアップとして効果的に用いることで、分散画像分類における尾遅延を低減できるか?
  • RQ2冗長推論に使用する際、コラージュ-CNNの精度は標準パリティモデルと比べてどの程度か?
  • RQ3コラージュ推論はリプリケーションと比較して、99百分位の遅延と分散をどの程度低減できるか?
  • RQ4MLaaS推論における符号化冗長性を用いる際、精度、リソースコスト、遅延低減の間のトレードオフはいかなるものか?

主な発見

  • コラージュ推論は、クラウド環境での展開において、リプリケーションベースの手法と比較して99百分位の推論遅延を1.2倍から2倍まで低減する。
  • 遅延分散は1.8倍から15倍まで低減され、応答時間の整合性が著しく向上する。
  • 3×3のコラージュ-CNNはCIFAR-10で78.3%の精度を達成し、同サイズの学生モデル(57%)およびParMのパリティモデル(74%)を上回る。
  • 4枚のCIFAR-10画像を分類する際、同じ計算リソースを用いてもコラージュ-CNNはParMのパリティモデル(88.91% 対 74%)よりも高い精度を達成する。
  • ResNet-34を教師モデルとして用いた知識蒸留により、圧縮モデルの精度が向上するが、カスタムコラージュ-CNNは依然としてそれらを上回る。
  • この手法により、プロアクティブリプリケーションの高コストや近似手法による精度損失を回避しつつ、効果的な遅延リクエスト対策が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。