Skip to main content
QUICK REVIEW

[论文解读] Collage Inference: Using Coded Redundancy for Low Variance Distributed Image Classification

Krishna Giri Narra, Zhifeng Lin|arXiv (Cornell University)|Apr 27, 2019
Advanced Neural Network Applications参考文献 42被引用 4
一句话总结

本文提出了一种称为拼贴推理(collage inference)的编码冗余技术,该技术利用一种定制的卷积神经网络(拼贴-CNN,collage-cnn)在单次推理过程中同时分类多张图像,以降低分布式图像分类中的尾部延迟。通过将多个请求视为一个整体,并使用低成本的多图像分类器作为备份,该方法相比复制机制将第99百分位延迟降低了1.2倍至2倍,延迟方差降低了1.8倍至15倍,同时保持了较高的准确性。

ABSTRACT

MLaaS (ML-as-a-Service) offerings by cloud computing platforms are becoming increasingly popular. Hosting pre-trained machine learning models in the cloud enables elastic scalability as the demand grows. But providing low latency and reducing the latency variance is a key requirement. Variance is harder to control in a cloud deployment due to uncertainties in resource allocations across many virtual instances. We propose the collage inference technique which uses a novel convolutional neural network model, collage-cnn, to provide low-cost redundancy. A collage-cnn model takes a collage image formed by combining multiple images and performs multi-image classification in one shot, albeit at slightly lower accuracy. We augment a collection of traditional single image classifier models with a single collage-cnn classifier which acts as their low-cost redundant backup. Collage-cnn provides backup classification results if any single image classification requests experience slowdown. Deploying the collage-cnn models in the cloud, we demonstrate that the 99th percentile tail latency of inference can be reduced by 1.2x to 2x compared to replication based approaches while providing high accuracy. Variation in inference latency can be reduced by 1.8x to 15x.

研究动机与目标

  • 解决由于资源争用和慢速请求(straggler)效应导致的云环境分布式图像分类中高尾部延迟与高方差问题。
  • 设计一种低成本、可扩展的冗余机制,避免在机器学习即服务(MLaaS)环境中请求复制带来的高开销。
  • 开发一种专用的卷积神经网络架构(拼贴-CNN,collage-cnn),能够实现多图像分类且精度损失极小,用作备份系统。
  • 评估拼贴推理在真实云部署中降低推理延迟与方差,同时不牺牲预测准确性的有效性。

提出的方法

  • 拼贴-CNN模型将多张输入图像通过空间拼接形成一张拼贴图像,作为单一多目标输入进行联合分类。
  • 单个拼贴-CNN作为多个独立图像分类器(s-cnn模型)的编码冗余备份,当任一独立请求变慢时,可提供备用预测。
  • 该方法利用负载均衡器将多个推理请求聚合成一个整体,实现高效的批量处理与冗余机制,且附加成本极低。
  • 拼贴-CNN的训练数据通过数据增强与知识蒸馏技术生成,其中s-cnn(ResNet-34)作为教师模型以提升性能。
  • 该架构针对多目标分类进行了优化,在准确率上优于类似框架(如ParM)中使用的标准奇偶校验模型。
  • 系统在云环境中进行部署,以评估真实世界性能,并与基于复制的方法对比延迟与方差。

实验结果

研究问题

  • RQ1能否有效利用单个多图像分类器作为低成本备份,以降低分布式图像分类中的尾部延迟?
  • RQ2在冗余推理中,拼贴-CNN的准确率与标准奇偶校验模型相比如何?
  • RQ3与请求复制相比,拼贴推理在多大程度上能降低第99百分位延迟与方差?
  • RQ4在MLaaS推理中使用编码冗余时,准确率、资源开销与延迟降低之间的权衡关系如何?

主要发现

  • 在云部署中,拼贴推理相比基于复制的方法将第99百分位推理延迟降低了1.2倍至2倍。
  • 该方法将延迟方差降低了1.8倍至15倍,显著提升了响应时间的一致性。
  • 3×3的拼贴-CNN在CIFAR-10数据集上达到78.3%的准确率,优于同等规模的学生模型(57%)和ParM的奇偶校验模型(74%)。
  • 在对四张CIFAR-10图像进行分类时,尽管使用相同的计算资源,拼贴-CNN模型的准确率(88.91%)仍高于ParM的奇偶校验模型(74%)。
  • 使用ResNet-34教师模型进行知识蒸馏可提升压缩模型的准确率,但定制的拼贴-CNN仍表现更优。
  • 该方法在不引入主动复制的高计算与存储开销,也未造成近似技术的准确率损失的前提下,实现了有效的慢速请求缓解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。