[论文解读] Rethinking Pareto Frontier for Performance Evaluation of Deep Neural Networks
本文提出一种随机多维Pareto前沿,通过联合优化准确率、推理延迟(云和边缘硬件)以及训练成本,客观评估深度神经网络。通过参数自举法引入随机波动,该方法实现了在多样化硬件上的稳健模型排序,揭示了尽管存在性能波动,MobileNetV3 和 SqueezeNetV1.1 在效率方面始终占优。
Performance optimization of deep learning models is conducted either manually or through automatic architecture search, or a combination of both. On the other hand, their performance strongly depends on the target hardware and how successfully the models were trained. We propose to use a multi-dimensional Pareto frontier to re-define the efficiency measure of candidate deep learning models, where several variables such as training cost, inference latency, and accuracy play a relative role in defining a dominant model. Furthermore, a random version of the multi-dimensional Pareto frontier is introduced to mitigate the uncertainty of accuracy, latency, and throughput of deep learning models in different experimental setups. These two complementary methods can be combined to perform objective benchmarking of deep learning models. Our proposed method is applied to a wide range of deep image classification models trained on ImageNet data. Our method combines competing variables with stochastic nature in a single relative efficiency measure. This allows ranking deep learning models that run efficiently on different hardware, and combining inference efficiency with training efficiency objectively.
研究动机与目标
- 解决缺乏同时考虑推理和训练效率的客观、多维基准测试方法的问题。
- 通过引入随机Pareto前沿,缓解因随机训练和硬件特定延迟导致的DNN性能波动问题。
- 将准确率、多种硬件平台上的延迟以及训练成本等竞争性指标统一为单一的相对效率度量,用于模型比较。
- 通过定义模型之间的随机支配关系,实现在多样化硬件目标下的客观模型选择。
提出的方法
- 提出一个多维Pareto前沿,整合三个关键目标:top-1准确率、NVIDIA V100推理延迟、ARM Kirin 970边缘延迟,以及以美元计的训练成本。
- 通过在5次实验运行上使用参数自举法,引入随机Pareto前沿,以建模准确率、延迟和训练成本的随机波动。
- 定义相对效率度量θ̂为归一化得分,反映模型在所有目标上的主导性,从而实现跨模型比较。
- 采用随机支配关系对模型进行排序,其中从模型A指向模型B的箭头表示在不确定性下A在所有目标上均优于B。
- 基于ImageNet-1K训练模型的实际测量数据,计算效率分布并生成箱线图以可视化性能波动。
- 将该方法应用于多种图像分类模型(包括MobileNet、ResNet、DenseNet和MNASNet)在多个硬件平台上的评估。
实验结果
研究问题
- RQ1当模型在不同硬件平台上存在准确率、推理延迟和训练成本的权衡时,如何实现对深度学习模型的客观比较?
- RQ2模型性能(准确率、延迟、训练成本)的随机波动在多大程度上影响模型排序的可靠性?
- RQ3在使用多目标效率度量时,哪些深度学习模型在多样化硬件和训练条件下表现出持续的主导性?
- RQ4随机Pareto前沿能否有效捕捉并缓解深度学习模型评估中的性能不确定性?
主要发现
- MobileNetV3 和 SqueezeNetV1.1 的相对效率最高,且箱线图分布狭窄,表明其在多次运行和多种硬件平台下均表现稳健。
- ShuffleNetV2 和 MobileNetV3 展现出强大的随机支配性,即使在性能波动下仍保持高效,其效率得分始终接近100%。
- DualPathNet92 表现最差,其效率分布低于20%阈值,表明其鲁棒性和主导性均较差。
- 引入训练成本显著改变了模型排名:尽管在仅考虑延迟时MobileNetV3占优,但当考虑训练成本时ShuffleNetV2的效率更高。
- 图3(b)中的随机支配图证实,如MobileNetV3和SqueezeNetV1.1等模型在所有目标上均优于其他模型,即使在不确定性下也保持主导地位。
- 该方法成功通过整合此前被忽视的训练成本,重新定义了效率,构建了一个统一、客观的DNN基准测试框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。