QUICK REVIEW
[论文解读] Graphcore C2 Card performance for image-based deep learning application: A Report
Ilyes Kacher, Maxime Portaz|arXiv (Cornell University)|Feb 26, 2020
Advanced Neural Network Applications参考文献 9被引用 7
一句话总结
本论文评估了Graphcore C2卡在图像类深度学习推理任务中使用ResNeXt101模型的性能表现。通过Poplar SDK和PopART运行时在混合精度模式下利用两颗IPU处理器,C2卡在批量大小为12时实现了最低1.36毫秒的延迟和最高2,526.35张图像/秒的吞吐量,能效峰值达到9.68张图像/秒/瓦。
ABSTRACT
Recently, Graphcore has introduced an IPU Processor for accelerating machine learning applications. The architecture of the processor has been designed to achieve state of the art performance on current machine intelligence models for both training and inference. In this paper, we report on a benchmark in which we have evaluated the performance of IPU processors on deep neural networks for inference. We focus on deep vision models such as ResNeXt. We report the observed latency, throughput and energy efficiency.
研究动机与目标
- 评估Graphcore C2卡在实时图像类深度学习推理任务中的性能表现。
- 测量IPU处理器在ResNeXt101等大型视觉模型上的延迟、吞吐量和能效表现。
- 评估不同批量大小对系统性能和效率的影响。
- 探索C2卡在生产规模、低延迟应用场景中的可行性。
提出的方法
- 基准测试使用一块Graphcore C2卡,其内含两颗IPU处理器,每颗独立处理一个推理会话,实现并行计算。
- 将ResNeXt101模型从PyTorch导出为ONNX格式,并使用PopART(Poplar SDK的图执行运行时)进行推理执行。
- 采用混合精度推理以提升性能与效率,充分利用IPU特有的优化能力。
- 在批量大小2至12范围内测量延迟、吞吐量和能效,功率消耗通过gc-monitor工具进行监控。
- 吞吐量计算为每秒处理的图像数量,能效以每秒处理图像数每瓦计算,基于平均功率测量结果得出。
- 实验使用COCO验证集中的10,000张图像,每颗IPU处理大小为1至6的微批次。
实验结果
研究问题
- RQ1在不同批量大小下,Graphcore C2卡在ResNeXt101推理中可实现的最低延迟是多少?
- RQ2在C2卡上,不同批量大小下可达到的吞吐量和能效水平如何?
- RQ3随着批量大小增加,C2卡在延迟和能效方面的性能扩展特性如何?
- RQ4C2卡能否在实时、低延迟推理工作负载中保持高性能和高效率?
主要发现
- 在批量大小为2时,C2卡实现了最低1.36毫秒的延迟,展现出对实时应用的优异响应能力。
- 在批量大小为12时,吞吐量达到峰值2,526.35张图像/秒,表明在高负载下具有出色的可扩展性。
- 在批量大小为10时,能效达到峰值9.68张图像/秒/瓦,表明在较大批量下实现最优能效表现。
- 从批量大小8开始,系统保持稳定的每瓦图像处理数比率,表明在高吞吐量配置下效率一致。
- 从批量大小8到12,系统性能稳定,能效成本增加极小,表明其适用于吞吐量优化型工作负载。
- 硬件与SDK支持通过流水线实现高效的模型并行,可部署超出单个IPU内存容量的大型模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。